微软发布两款自研AI模型:不抄别人作业,自己从头写

来源:互联网 时间:2026-07-24

当地时间7月23日,微软宣布推出两款新的自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前均已进入公开预览阶段。

这两款模型分别面向高质量图像生成和高并发语音交互场景。但真正让行业关注的,不是它们的功能,而是微软做这两款模型的方式。

微软说了三句话,句句都有深意。

第一句:“不依赖第三方模型蒸馏。”

过去一年,微软开始开发基于内部训练流程的专用模型,使用经过清理、可追踪、企业级的数据进行训练,不依赖第三方模型蒸馏,从底层设计以服务微软产品用户。

翻译一下:微软不再“抄”别人的模型了。此前行业里不少模型是通过蒸馏OpenAI的模型来“速成”的,微软这次明确表示——我们自己从头训练。

第二句:“已全面替换Bing和PowerPoint中的第三方模型。”

微软透露,Bing Image Creator已全面采用微软自研图像模型,MAI-Image-2.5成为其默认图像生成模型。在PowerPoint中,该模型已用于图像到图像编辑功能。在OneDrive中,它已成为部分图像编辑功能的默认模型。

更关键的是成本——相比GPT-Image-2,MAI-Image-2.5可降低最高84%的GPU成本。部署后相关场景保存成功率提升26%,P95延迟降低约25%,中等负载生产环境中效率提升2.5倍。

第三句:“已经有人用了。”

语音模型MAI-Voice-2-Flash已接入Dynamics 365 Contact Center,用于企业客服智能体服务,可降低最高89%的GPU成本,已应用于T-Mobile、EasyJet等客户的相关场景。医疗语音解决方案Dragon Copilot使用MAI-Transcribe-1.5,被17万名医疗服务提供者使用,上季度处理了2800万次患者问诊记录。

微软的这步棋,打得很有章法。

过去几年,微软是OpenAI的最大金主,深度绑定GPT系列模型。但从去年开始,微软明显在两条腿走路——一边继续用OpenAI的模型,一边悄悄搭建自己的模型能力。MAI系列就是这条“备胎”路线的产物。

现在,这条“备胎”路线已经可以独当一面了。从Bing到PowerPoint,从OneDrive到Dynamics——微软正在用自研模型一步步替换掉第三方模型。这不仅是为了省钱,更是为了掌握核心技术、降低对外部供应商的依赖。

在AI这个赛道里,谁能掌握模型,谁就掌握话语权。微软正在用实际行动证明:我们不只会投资别人,我们自己也能做。

相关文章

A5创业网 版权所有

返回顶部