A5站长网10月2日消息,开源AI智能体平台openJiuwen把WorkSwarm的全双工多模态能力放了出来。这套东西想解决的是一个很日常的别扭:让智能体去查资料、跑分析的时候,对话还能不能继续。它的做法是把实时交互和执行拆成两条路同时跑,用户随时可以插话。
全双工是相对半双工说的。传统语音助手更像对讲机,一方说完,另一方才接得上;智能体播报的时候用户插一句,往往会被打断或者干脆被忽略。全双工则更接近打电话,系统可以边听边说,用户随时打断、补充。落到实现上,系统靠语音活动检测和噪声门限判断是不是有效人声,一旦确认,就停下当前播报、开始处理新指令,而已经生成的那段文字仍然留在任务记录里。
架构上分成两条并行的路径。实时模型这一路负责看屏幕、听声音和即时回应;Core Agent这一路负责拆解任务、调用搜索与分析工具、生成文件,驱动那些耗时较长的工作。两条路各自按自己的节奏走,Core Agent在后台检索的时候,前台的对话不会停,用户依然可以问屏幕上的内容、打断播报或者追加要求。
任务队列为后续的每个请求留了等待位,可以重排顺序、把某个任务提到下一个执行,或者停止正在等待和运行的任务。界面上显示的不只是转圈,还有任务状态、工具调用、执行结果和生成的文件。音视频连接与工具任务分开管理,关掉实时会话并不会终止Core Agent的任务,重新连上以后,文字、工具输出和文件会回到原来的对话里。
部署上的选择比较开放。官方提供Windows、Mac、HarmonyOS的一键安装包;协议栈既支持Qwen Omni的实时websocket,也支持JoyAI这套由语音识别、大模型、语音合成三部分组成的流水线。要在昇腾NPU上跑全双工多模态模型,可以经华为云ModelArts用vLLM-Omni推理框架部署。openJiuwen这个平台本身由华为2012实验室、华为云等团队联合高校与企业开发者共同构建。
把等待感从交互里挤出去,正在成为这一轮智能体产品的共同方向。背后的判断是,工具执行本身就要花时间,用户的新问题却随时会来,与其让人等一个后台任务跑完,不如让两条时间线并行。对使用者来说,真正值得留意的不是能插话这个动作,而是插话之后任务不会乱,这取决于队列管理、结果回流和状态可见性做得多细。
A5创业网 版权所有