
随着复杂Agent任务与对话场景深度融合,openJiuwen WorkSwarm全双工多模态能力为用户带来全新交互范式。该平台以对话与后台执行并行为核心,解决实时交互与任务处理的时间约束问题,推动AI助手从被动应答转向主动办事。具体来看,全双工设计实现了边听边说、实时续接的交互模式,既压缩了用户等待时间,又能应对多语、多场景需求;在此基础上,平台结合Core Agent执行工具任务,支持音视频、图文多模态与实时模型协同,覆盖办公、编码等多场景应用。当前,其具备一键安装、任务队列调度等便捷功能,可适配多系统运行,为开发者的Agent协作提供了兼具时效性与可操作性的技术支撑,标志着AI在复杂场景下的协同效率持续提升。
--91likeyou---
WorkSwarm 全双工多模态能力正围绕这一体验展开。openJiuwen 是由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者联合构建的开源 AI Agent 平台,WorkSwarm 即为其开源的办公编码统一工作台,它把实时音视频交互与 Core Agent 执行接入同一个任务:用户可以展示眼前画面、随时插话,也可以把需要进一步处理的工作交给 后台 Core Agent。
这套能力并非停留在演示层面,openJiuwen 提供了 Windows、Mac、HarmonyOS 等系统的一键安装包,进入官网下载安装,即可立即体验
能插话,才算实时对话
人和人交流,很少严格遵守“一方说完,另一方再开口”。看到新画面、发现理解偏了,或者只想先听重点,用户都会直接补上一句。
“先别介绍背景,直接说结论。”
这句话可以在 WorkSwarm 播报时说出来。系统检测到新的有效人声后,会停止当前播报,开始处理新指令;已经生成的文字仍保留在任务记录里。语音活动检测与噪声门限,则用来降低背景声造成的误打断。
视频里我们让 Agent 先朗读《岳阳楼记》,在过程中直接语音说朗读《兰亭集序》,可以自然的快速切换。
插话改变的是当前对话。已经交给 Core Agent 的工具任务有独立的运行状态,要取消它,得单独去任务控制里手动停止。用户说话时,系统要同时处理两个层面的事:对话层接住新要求,任务层管好已经跑起来的工作。
用户插话时,当前播报停止;新的要求继续进入同一个任务,而不是另起一段割裂的对话。
一边聊,一边办事
“这是什么品牌?”之后,用户可能还会补上一句:“查一下它的资料,整理成一份文档。”
一个看图问题,就这样变成了需要搜索、分析和文件生成的任务。而资料还没查完,用户的新问题可能已经来了。
WorkSwarm 用两条路径接住这两种节奏:实时模型负责看画面、听要求、及时回应;Core Agent 负责拆解任务、调用工具,把后续工作推进下去。
搜索在后台运行,对话在前台继续。用户仍能追问眼前的画面,也能随时打断播报、补充要求。
当任务进入 Core Agent,页面会持续呈现任务状态、工具调用记录、执行结果和文件产物。用户看到的不再只是一个旋转的“加载中”,而是事情正在怎样向前推进。
视频中我们先下发了一个任务,让他通过工具调用,去阅读我们算法 word 文档,在这个过程中,我们可以在右上角任务队列看到任务正在运行,并且我们这个时候还能正常和 agent 聊天。
在任务完成后,我们不会打断在聊天的对话,但是会先在文本框中输出我们的总结信息(如下图),然后在这一轮对话结束后,才会汇报工作,说总结文档的工作完成了,并且像人类汇报工作一样,提取重要信息说明,不会全部信息语音输出。
真实界面中,实时回答、Core Agent 运行状态和最终结果都回到同一个任务。
边聊边办事,任务各走各的
前一个搜索还没结束,用户又交代了第二件事,怎么办?
WorkSwarm 的全双工任务队列,为后续要求安排了等待位置。用户可以调整顺序,把某项任务设为下一项;也可以停止等待中或正在执行的任务。对话持续进行时,哪些事在做、哪些还没开始,都有明确状态。
在右上角的我们可以手动移动每个任务的顺序,从而调度运行的队列,并且直接一键置顶、打断现有运行任务。
音视频连接与工具任务也分别管理。即使关闭全双工音视频,已经提交给 Core Agent 的任务仍可继续执行。完成后的文字、工具结果和文件,会回到原来的对话中。
例如,通过镜头发起品牌查询后,用户可以结束音视频交互,稍后再回来查看资料。现场交代的工作,由此有了可追踪的执行过程。
工具任务可以排队、调整和停止;音视频连接与后台任务不再被简单绑定。
所以,WorkSwarm 全双工多模态能力的意义,不只是让 AI 能“边听边说”,而是让实时对话与 Core Agent 的后台执行真正并行:用户在前台像聊天一样随时打断、追问、补充,复杂任务在后台按自己的节奏继续查资料、调工具、做分析。这种“对话不中断、任务不停跑”的体验已经走出演示,开始成为可用的协作方式。当 AI 不再要求人迁就回合,而是像同事一样边聊边办,人机协同的下一段节奏,也就此开始。
如何使用:
模型和语音通道可以在设置中配置
目前支持 JoyAI 协议和 Qwen Omni 协议,可以点击模型通道去切换 a)Qwen Omni realtime websocket 可以填官网 base_url 或者本地部署地址
JoyAI 是三种模型拼接(ASR, LLM, TTS)所以支持三种都使用官方 api,或者其他平台的 ASR 和 TTS 模型。
此外,还支持基于使用华为云 ModelArts 平台,基于 vLLM-Omni 推理框架,在昇腾系列 NPU 部署全双工多模态模型,对接 WorkSwarm 多模态全双工能力。
参考资料:
在线体验,领免费 Token:
相关资源:
一键下载:
GitHub:
AtomGit:
Agentic Hub:
使用华为云 ModelArts 在昇腾 NPU 部署全双工多模态模型参考:
🔥 热词:#AI · #Agent · #首发 · #openJiuwen · #workSwarm全双工多模态 · #像聊天一样与Agent交互 · #昇腾算力原生亲和 · #复杂