Microsoft-Decision-1 不是用來陪你聊天或者代筆的通用模型,而是專門替預設選項評分:應用程式提供背景資料和一組答案,模型就會為各個選項給出機率分數,供程式採取下一步行動。微軟於 2026 年 10 月 9 日公布這款模型,定位包括分類、路由和評估等結構化決策工作。
1
簡單講,如果工作本身只需要「揀邊個選項」,未必每一步都要另一個模型先寫一大段解釋。這類決策結果可直接交畀軟件流程處理;不過,機率分數並不代表答案一定正確。
點樣為選項評分?
應用程式會提供相關內容,以及一組固定答案。Microsoft-Decision-1 會在一次評分流程中,為每個選項輸出機率,而唔係生成一段自由文字。
14 微軟及相關資料提到的任務形式包括是非題、多項選擇、評分、分類,以及按評分準則評估答案。
6
22
例如,客服系統可以提供幾個查詢類別,再根據分數決定把個案送去邊個處理隊列。AI agent 亦可以用分數輔助選擇下一步:繼續執行、再試一次,或者交由人手覆核。呢啲係可行的工作流程設計,並唔等於已有證據證明整個流程一定會快幾多。
點解唔直接用聊天模型?
好多軟件任務需要的是一個結構化選擇,而唔係一段解說。專門為有限選項評分的模型,可以提供應用程式較容易直接使用的結果。微軟將 Decision-1 定位於決策及分類用途,包括路由和評估。
1
但它的用途亦有界限:如果工作需要解釋答案、撰寫內容,或者進行開放式對話,Decision-1 並不能取代生成文字的模型。實際應用上,團隊可以用生成式模型負責內容,再由決策模型處理較狹窄的任務,例如揀選類別或評估候選回覆。
模型基礎、供應平台與價格
微軟表示,Decision-1 以阿里巴巴的 Qwen3.5-9B 為基礎,再針對決策評分進一步訓練。
1 微軟發布資料列明,模型已在 Microsoft Foundry 的目錄以公開預覽形式提供。
1
公布價格為每百萬個輸入 token 0.042 美元,輸出 token 不收費。
11 價格是否划算,仍要視乎實際工作量,例如每次送入多少背景資料,以及需要作出幾多次決策。
微軟公布的測試結果,應該點樣理解?
微軟表示,Decision-1 在涵蓋近 15 萬條問題的 36 項基準測試比較中排名第一;公司亦稱,測試中的延遲表現較 Quyet-1.0-Large 快 4.5 倍、較 GPT-6 Sol 快 35 倍。
12
5
以上是微軟公布的基準測試結果,並非獨立驗證,也不能直接推論 Decision-1 在每種應用中都會更快或更準。測試結果會受任務類型、比較模型和測試設定影響。團隊在正式依賴模型處理流程前,應先用自己的資料測試,並衡量決策質素、延遲,以及判斷錯誤可能帶來的後果。
核心概念其實直接:如果工作是從有限選項中作出結構化選擇,可以考慮用專門評分的模型,而唔係每次都叫通用模型生成文字。至於它能否真正帶來效益,關鍵仍是它在特定工作場景中是否可靠。