全双工多模态!openJiuwenWorkSwarm开启实时交互新体验

华为开源 AI Agent 平台 openJiuwen 推出 WorkSwarm 办公工作台,支持全双工多模态交互。用户可边对话边处理任务,系统同时运行实时模型与 Core Agent,实现语音、视频...

人工智能

在人工智能助手领域,一个长期困扰用户的痛点是:当助手正在处理需要时间的任务时,用户的新问题该如何应对?传统模式下,助手往往需要完成当前任务后才能响应新需求,导致等待感和交互割裂。近日,华为开源 AI Agent 平台 openJiuwen 发布其办公编码统一工作台 WorkSwarm,通过全双工多模态能力,为这一问题提供了全新解决方案。

WorkSwarm 的核心在于实现了真正的“边听边说”交互模式。与传统语音助手类似对讲机的单向交流不同,WorkSwarm 支持用户随时打断或补充指令,系统能同时处理前台对话和后台任务。例如,当用户让 AI 朗读《岳阳楼记》时,可以随时切换到朗读《兰亭集序》,而无需等待当前任务结束。这种设计让用户能够像与真人交流一样,根据需要灵活调整对话节奏。

从技术架构来看,WorkSwarm 将实时音视频交互与 Core Agent 执行深度整合。用户可以通过摄像头、共享屏幕或麦克风输入信息,系统会持续采集并编排任务。同时,实时多模态模型(如 JoyAI / Qwen Omni)负责即时回答,而 Core Agent 则承接复杂任务,包括推理、工具调用和文件生成等。这种双轨运行机制确保了前台对话的流畅性,同时后台任务也能高效推进。

为了提升用户体验,WorkSwarm 还引入了任务队列管理功能。当用户连续提出多个任务时,系统会自动将后续任务安排到等待位置,并允许用户调整任务优先级。如果需要取消某个任务,可以直接在任务控制界面手动停止。此外,即使关闭全双工音视频交互,已经提交给 Core Agent 的任务仍可继续执行,完成后结果会返回到原来的对话中。

图2

在实际应用场景中,WorkSwarm 的表现令人印象深刻。例如,在阅读算法文档的过程中,用户可以一边与 AI 讨论内容,一边让 AI 调用工具进行分析和总结。当任务完成后,系统不会打断当前对话,而是先在文本框中输出总结信息,待本轮对话结束后再汇报工作进度。这种设计既保持了对话的连贯性,又确保了任务执行的完整性。

openJiuwen WorkSwarm 的发布,标志着 AI 助手从简单的问答工具向真正的协作伙伴迈进了一大步。它不仅提升了交互的自然度和效率,也为未来的智能办公场景开辟了新的可能性。目前,WorkSwarm 提供 Windows、Mac 和 HarmonyOS 等系统的安装包,用户可以登录官网下载体验这一创新产品。