微軟再推兩款自研MAI模型,且全面應用於核心產品

微軟的人工智能研究實驗室Microsoft AI日前在 官方博客 上宣佈,他們的MAI產品線再添兩款自研模型變體:MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash,這兩款模型目前已進入公開預覽(public preview)階段。

其中,MAI-Image-2.5-Pro 定位為“質量優先”的旗艦圖像模型,是微軟迄今保真度最高的圖像模型,主打高精度圖像生成、細節化編輯以及準確的圖內文字渲染(in-image text rendering),並支持自然語言指令編輯。定價為每百萬文本輸入 token 5 美元、每百萬圖像輸入 token 8 美元、每百萬圖像輸出 token 106 美元。

MAI-Voice-2-Flash 則主打速度與規模,面向高併發語音場景。相比 MAI-Voice-2,其速度提升 2 倍、成本降低 32%,定價為每百萬字符 15 美元,同時在自然韻律(prosody)與聲學質量上保持旗艦水準。

值得注意的是,這兩款模型並非僅停留在榜單刷分。微軟強調,自研 MAI 系列已大規模落地核心產品:Bing Image Creator 已 100% 切換至 MAI-Image-2.5;PowerPoint 的圖像生成與編輯中,MAI-Image-2.5的GPU 成本較 GPT-Image-2 降低最多 84%;而OneDrive 圖像編輯場景切換為 MAI-Image-2.5 後,保存率提升 26%、P95 延遲下降約 25%;Dynamics 365 Contact Center(客户含 T-Mobile、EasyJet)改用 MAI-Voice-2-Flash,GPU 成本最多降 89%。

此外,微軟還提到了他們在專業領域上的成果——他們與醫療方案 Dragon Copilot 合作,後者服務 17 萬醫療提供者、上季度處理 2800 萬次就診記錄;MAI-Transcribe-1.5 已接替原有模型,覆蓋 58 種語言,在多數語言上轉錄與語種識別錯誤率相對下降 50%。

微軟表示,這一系列更新都指向同一目標——用微軟自研模型驅動微軟自有產品;其強調模型在內部訓練、不依賴第三方模型蒸餾,並希望通過提供質量、速度、成本各異的模型選項,讓用户與開發者獲得更多選擇與更高性價比。