# 微软推出自研AI模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash，已进入公开预览

- 来源：IT之家（RSS）
- 发布时间：2026-07-24 08:00
- AIHOT 分数：59
- AIHOT 链接：https://aihot.virxact.com/items/cmry83vs3001lropq370gqz97
- 原文链接：https://www.ithome.com/0/980/899.htm

## AI 摘要

微软发布两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash，均进入公开预览，强调使用企业级数据训练、未蒸馏第三方产品。MAI-Image-2.5-Pro为微软最高精度图像模型，文本输入每百万token 5美元；MAI-Voice-2-Flash速度提升约2倍、成本降低32%，每百万字符15美元。

## 正文

IT之家 7 月 24 日消息，微软当地时间 7 月 23 日宣布推出两款新的自研 AI 模型，分别为 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash，目前均已进入公开预览阶段。两款模型属于微软 AI 团队自研模型系列，分别面向高质量图像生成与高并发语音交互场景。

微软表示，过去一年，公司开始开发基于内部训练流程的专用模型，目标是使用经过清理、可追踪、企业级的数据进行训练，不依赖第三方模型蒸馏，并从底层设计以服务微软产品用户。

MAI-Image-2.5-Pro 是微软目前精度最高的图像模型，主要面向对图像质量要求较高的应用场景，包括主视觉图片生成、细节编辑以及图像内文字渲染等功能。

微软称，该模型在图像中文字生成准确性方面进行了优化，并支持自然语言编辑指令，用户可以通过文字描述调整生成内容。

该模型公开预览价格为：文本输入每 100 万个 Token 收费 5 美元（现汇率约合 33.9 元人民币），图像输入每 100 万个 Token 收费 8 美元（现汇率约合 54.3 元人民币），图像输出每 100 万个 Token 收费 106 美元（IT之家注：现汇率约合 718.8 元人民币）。

另一款模型 MAI-Voice-2-Flash 则针对高频语音应用进行了优化。微软表示，该模型相比 MAI-Voice-2 速度提升约 2 倍，同时成本降低 32%，能够在保持自然语调和较高语音质量的情况下，为大规模语音服务提供更低延迟支持。

MAI-Voice-2-Flash 的公开预览价格为每 100 万个字符 15 美元（现汇率约合 101.7 元人民币）。微软表示，该模型适用于客服中心、语音助手等需要快速响应的场景。

微软透露，目前两款模型已经逐步应用于旗下多个产品。其中，Bing Image Creator 已全面采用微软自研图像模型，MAI-Image-2.5 成为其默认图像生成模型，为用户提供图像生成和编辑能力。

在 PowerPoint 中，MAI-Image-2.5 已用于图像到图像编辑功能。微软称，与 GPT-Image-2 相比，该模型可降低最高 84% 的 GPU 成本。

在 OneDrive 中，MAI-Image-2.5 已成为部分图像编辑功能的默认模型。微软数据显示，部署后相关场景保存成功率提升 26%，P95 延迟降低约 25%，在中等负载生产环境中的效率提升 2.5 倍。

语音方面，MAI-Voice-2-Flash 已接入 Dynamics 365 Contact Center，用于企业客服智能体服务。微软表示，该模型可降低最高 89% 的 GPU 成本，并已应用于包括 T-Mobile、EasyJet 等客户的相关场景。

此外，微软还将 MAI-Voice-2-Flash 集成至 Azure Voice Live 服务，开发者可以利用该模型构建支持语音到语音交互的智能体。

微软还表示，其自研模型正在与专业领域合作伙伴结合。例如，MAI-Transcribe-1.5 已应用于医疗语音解决方案 Dragon Copilot，该服务目前被 17 万名医疗服务提供者使用，上季度处理了 2800 万次患者问诊记录。

微软称，MAI-Transcribe-1.5 支持 58 种语言，在内部多语言录音测试中，大多数语言的语音转录错误率和语言识别错误率均实现 50% 的相对下降，早期研究显示，其生成医疗记录的准确性也有所提升。

微软表示，MAI 系列模型将继续扩展，并通过 Foundry 平台提供给开发者使用。公司同时透露，微软 AI 团队下一代 GB200 计算集群目前已经投入运行，并将继续推进后续模型研发。
