A5站长网9月19日消息,阿里云通义千问团队发布新一代原生全模态模型 Qwen3.8-Omni-Flash。模型在文本、图像、音频、视频四类输入上原生处理,不再依赖先把语音转写、再抽帧拼接的多模型组合。官方公布的降幅集中在成本端:音频输入每小时 API 价格下降超过 98%,音频加视频联合输入下降超过 93%。按官方口径,每小时成本以 2 分钟素材的处理价格乘以 30 估算,视频按 720p、每秒 1 帧的输入条件计算。

跟随成本一起放开的还有输入长度。Qwen3.8-Omni-Flash 的上下文窗口为 100 万 Token,最大输入接近 99.2 万 Token,思考模式下约为 98.4 万,最大输出 13.1 万 Token。模型可以处理 113 种语言和方言的音频输入,支持双声道立体声与四声道空间音频分析,并提供函数调用、联网搜索与上下文缓存。这些能力叠加起来,改变的是处理长素材的方式:开发者不必再频繁切片、抽帧,也不必把语音识别、视觉理解与文本推理拆给不同的模型分别完成。
评测层面,官方称在累计约 30 项评测中,该模型较上一代 Qwen3.5-Omni-Plus 平均得分提升超过 25%。音视频智能体方向的提升更明显,WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分。多说话人会议转录基准上的变化最直观:说话人分离错误率与拼接字符错误率从上一代的 88.11 与 89.61 降到 3.35 与 17.18。官方表示其音频能力整体超过 Gemini 3.8 Flash,音视频综合能力接近后者。
价格与获取方式同样明确。阿里云公布的国际区域定价为每百万 Token 输入 0.15 美元、命中缓存的输入 Token 0.016 美元、每百万输出 Token 0.47 美元,中国大陆及部分其他区域的价格另有不同。模型通过阿里云百炼提供服务,覆盖北京、新加坡、中国香港、日本东京、德国法兰克福与美国弗吉尼亚等区域。需要说明的是,本次并未直接开放模型权重,开放的是配套的多模态插件与开发工具。
应用方向上,团队这次主打“智能体交付”,也就是让模型分析长视频、定位关键内容,再调用工具完成视频编辑、内容整理、会议总结与字幕生成。同步开源的 Qwen-MM-Plugins 可安装到主流开发环境,为智能体补上图像、音频与长视频处理能力;Qwen-Live Harness 面向实时交互,接口兼容 OpenAI 协议。对做智能体应用的团队来说,成本下降带来的直接变化是长音频与海量视频素材的自动分析第一次变得可以负担,音视频从感知输入变成了执行任务的媒介。
A5创业网 版权所有