MAI-Image-2.5-Pro:目前 Microsoft 最高清嘅圖像生成模型,專為專業視覺設計、細緻編輯同埋圖像入面精準嘅文字渲染而設。佢嘅定價係透過 Microsoft Foundry,每 100 萬個文字輸入 token 收 $5 美金,每 100 萬個圖像輸入 token 收 $8 美金,而每 100 萬個圖像輸出 token 就收 $106 美金。
MAI-Voice-2-Flash:一個低延遲嘅文字轉語音模型,專為客戶服務同即時語音應用而設計。Microsoft 話佢比起標準版 MAI-Voice-2 快兩倍,仲要平 32%。
兩個模型已經喺 7 月 24 日透過 Microsoft Foundry 開放公開預覽,開發者可以即刻試用。
Microsoft 好快就將呢兩個模型整合落多個旗艦產品:
Microsoft 話自家 MAI 模型而家已經用喺超過一半嘅產品入面,嚟緊仲會擴展到 Excel 同 Outlook。
Microsoft 公布咗具體嘅 GPU 運算成本節省百分比 —— 呢個係指用自家模型比起授權或者托管 OpenAI 模型嗰陣,喺推論基建層面慳到嘅錢,唔係 API 定價分別:
| 模型 | 應用場景 | 比起 OpenAI 節省 GPU 成本 | 來源 |
|---|---|---|---|
| MAI-Image-2.5-Pro | PowerPoint(對比 GPT-Image-2) | 最多 84% | |
| MAI-Voice-2-Flash | Dynamics 365 Contact Center | 最多 89% | |
| MAI-Voice-2-Flash | 一般用途(對比 MAI-Voice-2) | 成本低 32%,速度快一倍 |
呢啲節省幅度足以改變 Microsoft 喺 Office 同雲端套裝嘅 AI 功能單位經濟效益。
呢兩個新模型係 Microsoft 喺 2026 年 6 月 Build 大會公布嘅七款 MAI 模型家族嘅特別變種:
MAI-Image-2.5-Pro 係頂級 premium 版本,專為追求最高圖像質素而設;而 MAI-Voice-2-Flash 就係速度優先版,適合高流量、低延遲嘅語音應用。整個 MAI 家族都係用 Microsoft 自家 Maia 200 晶片訓練,冇用第三方模型蒸餾,而且軟硬件協同設計令效率有 1.4 倍優勢。
Microsoft 正執行一個清晰嘅多階段策略,目標係建立完整嘅自家 AI 棧: