当地时间7月23日,微软宣布推出两款新的自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前均已进入公开预览阶段。
这两款模型分别面向高质量图像生成和高并发语音交互场景。但真正让行业关注的,不是它们的功能,而是微软做这两款模型的方式。
微软说了三句话,句句都有深意。
第一句:“不依赖第三方模型蒸馏。”
过去一年,微软开始开发基于内部训练流程的专用模型,使用经过清理、可追踪、企业级的数据进行训练,不依赖第三方模型蒸馏,从底层设计以服务微软产品用户。
翻译一下:微软不再“抄”别人的模型了。此前行业里不少模型是通过蒸馏OpenAI的模型来“速成”的,微软这次明确表示——我们自己从头训练。
第二句:“已全面替换Bing和PowerPoint中的第三方模型。”
微软透露,Bing Image Creator已全面采用微软自研图像模型,MAI-Image-2.5成为其默认图像生成模型。在PowerPoint中,该模型已用于图像到图像编辑功能。在OneDrive中,它已成为部分图像编辑功能的默认模型。
更关键的是成本——相比GPT-Image-2,MAI-Image-2.5可降低最高84%的GPU成本。部署后相关场景保存成功率提升26%,P95延迟降低约25%,中等负载生产环境中效率提升2.5倍。
第三句:“已经有人用了。”
语音模型MAI-Voice-2-Flash已接入Dynamics 365 Contact Center,用于企业客服智能体服务,可降低最高89%的GPU成本,已应用于T-Mobile、EasyJet等客户的相关场景。医疗语音解决方案Dragon Copilot使用MAI-Transcribe-1.5,被17万名医疗服务提供者使用,上季度处理了2800万次患者问诊记录。
微软的这步棋,打得很有章法。
过去几年,微软是OpenAI的最大金主,深度绑定GPT系列模型。但从去年开始,微软明显在两条腿走路——一边继续用OpenAI的模型,一边悄悄搭建自己的模型能力。MAI系列就是这条“备胎”路线的产物。
现在,这条“备胎”路线已经可以独当一面了。从Bing到PowerPoint,从OneDrive到Dynamics——微软正在用自研模型一步步替换掉第三方模型。这不仅是为了省钱,更是为了掌握核心技术、降低对外部供应商的依赖。
在AI这个赛道里,谁能掌握模型,谁就掌握话语权。微软正在用实际行动证明:我们不只会投资别人,我们自己也能做。
A5创业网 版权所有