2026年7月23日,微软AI超级智能团队正式将两款自研模型——MAI-Image-2.5-Pro(高保真图像生成)和**MAI-Voice-2-Flash**(企业级语音处理)——投入公开预览。这标志着微软在”自研模型驱动自家产品”的道路上迈出关键一步。

两个模型,两种定位
MAI-Image-2.5-Pro定位高端图像生成场景,定价为每百万文本输入token 5美元、每百万图像输入token 8美元、每百万图像输出token 106美元。它在Arena社区排行榜的图像编辑项目上已排名第二,广告巨头WPP全球首席创意官Rob Reilly评价该模型是”生成式媒体工具的一大飞跃”。
MAI-Voice-2-Flash则走另一个方向:运行速度比MAI-Voice-2快一倍,成本低32%,定价每百万字符15美元。它瞄准的是呼叫中心、语音客服、实时语音应用这类对延迟和成本极为敏感的大规模场景。
生产数据:GPU成本最高降89%
微软这次公布的部署数据,比模型本身更具冲击力。
Bing Image Creator已全面切换至MAI-Image-2.5,这是该消费者级图像工具首次完全由自研模型驱动。在PowerPoint中,MAI-Image-2.5比OpenAI的GPT-Image-2节省高达84%的GPU成本。在OneDrive的关键图像编辑场景中,保存率提升26%,P95延迟降低约25%,中等负载下效率提升2.5倍。
语音方面的数据同样亮眼。MAI-Voice-2-Flash已接入Dynamics 365 Contact Center——该平台服务于T-Mobile、EasyJet等客户——微软声称GPU成本最多降低89%。
医疗场景:Dragon Copilot覆盖58种语言
在医疗领域,微软的Dragon Copilot已接入MAI-Transcribe-1.5模型。该系统目前服务17万名医疗提供者,上一季度处理了2800万次患者诊疗记录,支持58种语言的多语言工作流。微软称,在大多数语言中,转录和语言识别错误率均降低了50%——在转录错误可能直接影响临床记录的场景中,这一改进意义重大。
战略转向:从”依赖OpenAI”到”微软产品由微软模型驱动”
“这些升级都指向同一个目标:微软产品,由微软模型驱动。”微软在其公告博客中写道。从Bing、PowerPoint、OneDrive到Excel、GitHub Copilot和Azure,7款核心产品已确认接入自研模型。
对于企业客户而言,这释放了一个明确的信号:微软的自研模型已不再是实验室项目,而是服务于数百万用户的生产级基础设施。这场AI军备竞赛的竞争维度,正在从”谁的模型最强大”转向”谁的模型最经济、最适配”。
图片来源:VentureBeat(AI生成配图)