微软于7月23日发布两款新模型进入公开预览:MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash;同时公布内部数据,客服中心改用 MAI-Voice-2-Flash 后算力成本降低 89%。微软执行长 Satya Nadella 称,当自家模型表现对标或超越前沿方案时就把流量导向 MAI。
MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 的功能定位与定价
MAI-Image-2.5-Pro 定位高阶影像生成,定价为每百万文字输入 token 5 美元、每百万图片输出 token 106 美元;Bing Image Creator 已全面改用 MAI-Image-2.5,WPP 全球创意长 Rob Reilly 在微软公告中称之为“生成媒体工具的一次重大跃进”。
MAI-Voice-2-Flash 定位大量语音处理场景(如客服中心),比前代快一倍、成本低 32%;客服中心换用此模型后算力成本降低 89%。此次公告同时披露了 Bing Image Creator、PowerPoint(GPU 成本较 GPT-Image-2 降低 84%)、OneDrive(存储率 +26%、延迟 -25%)和 Dragon Copilot(错误率 -50%)的部署成效。
GPU 成本节省的具体成绩
微软在公告中揭露的各场景成效如下:
MAI-Voice-2-Flash(客服中心语音):算力成本降低 89%;比前代快一倍、成本低 32%
MAI-Image-2.5-Pro(PowerPoint):GPU 成本较 OpenAI GPT-Image-2 降低 84%
OneDrive 换模型:存储率提升 26%,延迟降低约 25%
Dragon Copilot(MAI-Transcribe-1.5,医疗转录):服务 170k名医疗人员;上季处理 2 8M笔患记录;跨 58 种语言转录和语言辨识错误率相对降低 50%
MAI-Code-1-Flash(GitHub Copilot):代码采用率较 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%;Token 消耗少 10%;可在 H100 甚至 A100 GPU 上运行
Nadella 飞轮战略与 MAI 取代前沿模型的流量逻辑
Nadella 在 X 上以《前沿扩散与控制》为题发文,阐述微软的模型策略:当自家模型表现对标或超越前沿替代方案时,就把流量导向 MAI,以更低成本大规模提供服务。支撑此策略的是“hill-climbing”方法论:让资料、模型与产品“配套系统”形成持续迭代的飞轮,而非靠单次训练定生死。
他同时表示,评测系统“即使拿掉任何一个模型,都应该继续往上爬”——把记忆与技能留在模型之外,形成微软真正掌握的控制权。MAI-Code-1-Flash 在 Excel 的强化学习环境中加练后,可在旧款 H100 和 A100 GPU 上运行,在多数 Excel 任务上对标 GPT-5.6,同时释放最新 GB200 叢集用于训练而非服务请求。
常见问题
MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 的定价各为多少?
MAI-Image-2.5-Pro 定价为每百万文字输入 token 5 美元、每百万图片输出 token 106 美元,已在 Azure 公开预览中提供。MAI-Voice-2-Flash 比前代快一倍、成本低 32%,定价细节以 Azure 官方公告为准。
微软表示改用 MAI 模型后 GPU 成本最多降了多少?
根据微软公布的内部数据,客服中心改用 MAI-Voice-2-Flash 后算力成本降低 89%;PowerPoint 改用 MAI 图像模型后 GPU 成本较 GPT-Image-2 降低 84%;Dragon Copilot 换用 MAI-Transcribe-1.5 后转录和语言辨识错误率相对降低 50%。但上述数字全部来自微软内部评测,并非第三方独立基准测试。
企业客户如何通过 Azure 使用 Microsoft 的 MAI 训练方法?
微软通过 Azure 的 Foundry 和 Frontier Tuning 产品,让企业客户可以使用自己的资料训练专属模型;微软强调这些模型训练自“干净、可追溯的企业级资料,不经第三方模型蒸馏”,以回应训练资料来源的合规性问题。