微软发布高保真图像编辑生成与低延迟文本转语音模型
微软今日宣布进一步拓展其自研 AI 模型阵营,正式推出高保真图像生成与编辑模型 MAI-Image-2.5-Pro,并开启低延迟文本转语音模型 MAI-Voice-2-Flash 的公测。

作为微软迄今为止精度最高的图像生成模型,MAI-Image-2.5-Pro 专为需要精细化图像生成、二次编辑、主视觉海报设计以及更精准文本渲染的应用场景打造。在定价策略上,该模型每百万文本输入 Token 售价 5 美元,每百万图像输入 Token 售价 8 美元,每百万图像输出 Token 售价 106 美元。目前开发者与用户已可在 MAI Playground 平台免费体验该模型。
与此同时,微软发布的 MAI-Voice-2-Flash 专注于客服机器人等高并发、低延迟的语音应用场景。官方数据显示,在保持自然语调与高品质音质的前提下,MAI-Voice-2-Flash 的运行速度提升了一倍,成本降低了 32%,其定价为每百万字符 15 美元。
微软透露,旗下多项核心业务已全面接入自研 MAI 系列模型。例如,Bing Image Creator 已全量切换由 MAI-Image-2.5 驱动,PowerPoint 的图生图功能也已接入该模型;相比此前采用的第三方方案,切换至自研模型后 GPU 成本最高降低了 84%。在 OneDrive 中,MAI-Image-2.5 的应用使图像编辑保存率提升了 26%,P95 延迟降低约 25%。此外,MAI-Voice-2-Flash 已率先应用于 Dynamics 365 联络中心,节省了高达 89% 的 GPU 成本,并作为 Azure Voice Live 的一部分供开发者构建语音交互 Agent。多语言转录模型 MAI-Transcribe-1.5 也已成功为 Dragon Copilot 提供跨 58 种语言的听写服务。


