乍看之下,GPT-6 Astra 在不同新聞標題裡可能同時是「領先」、「打平」或「落後」。這通常不是哪一個結果必然錯誤,而是綜合排行榜、互動式代理測試、形式化數學基準與 API 定價,本來就在不同限制下衡量不同能力。
真正該問的不是「哪一款模型總體第一」,而是:哪個評測設定最接近你的實際工作?
排行榜分數不是單一的「智力計」
綜合型指數會把多種任務合成一個數字,而結果取決於題目組合、各項權重、受測模型設定,以及是否計入推理強度、工具使用與成本。一個模型可以在涵蓋面較廣的能力集合中表現突出,卻在偏重程式開發或代理任務的指數中落後。
這也表示單點分數會隨時間與設定改變。例如,提供的 Artificial Analysis 比較目前列出 GPT-6 Astra(max)為 55、Claude Fable 5.1 為 57;這與部分較早期比較文章所稱的 61 與 66 不同。
3 因此,閱讀排名時應記下評測日期與完整設定,不應把某次快照視為永久結論。
至於 Epoch AI「169 分 Capabilities Index、267 個模型中第一」的說法,現有的 Epoch 一手資料並未提供足以驗證的排行榜與方法細節。在沒有原始榜單、基準權重、模型設定與不確定性資訊前,不宜把它當成決定性比較依據。
ARC-AGI-3:測試框架一換,結果就不同
ARC-AGI-3 並非固定題目的問答測驗,而是互動式基準。代理必須在陌生環境探索、即時取得目標、建立可調整的世界模型,並從經驗中修正策略。
50
ARC Prize 在 Semi-Private 評測中公布 GPT-6 Astra 的兩項突出成績:
| 評測條件 |
最佳公布分數 |
每次執行的公布成本 |
| Standard harness(標準框架),max 推理 |
62.7% |
26,098 美元 |
| OpenAI Provider Adapter,高推理 |
99.9% |
18,817 美元(約 1.9 萬美元) |
51
52
這個落差不是無關緊要的技術註腳。Standard harness 採用最精簡、供應商中立的介面,模型只能攜帶它明確選擇保留的筆記;Provider Adapter 則能在請求之間保存供應商的隱性推理狀態,並對較長對話進行脈絡壓縮。
51
53
換言之,Provider Adapter 的成績衡量的是 Astra 加上 OpenAI 原生脈絡管理整合後的表現。這是實際產品能力的一部分,但不能自動與只透過中立介面測得的其他模型成績視為完全同類。ARC Prize 也明確指出,這兩種框架回答的是不同問題。
53
ARC Prize 另指出,Astra 在 96% 的關卡中,使用的操作步數少於受測人類中位數。
52 這代表它在「動作效率」上有可觀表現;但這不等於模型在所有工作上都比人類強,也不能取代在真實流程中比較任務完成率、可靠性與總成本。
FrontierMath Erdős 能證明什麼、不能證明什麼?
FrontierMath Erdős(FME)由 68 題截至 2026 年 8 月仍未解的 Erdős 問題組成。系統必須以 Lean 證明輔助器證明或反證猜想,因此提交的證明可被機械化驗證。
33
37
這種設計讓它成為檢驗形式化數學正確性時相當嚴格的基準。但數學成績不能直接變成整體程式能力、代理能力或一般推理能力的排名;它測量的是在明確預算下,系統完成狹窄且極高難度形式化證明任務的能力。
現有一手資料並未證實 Astra 在 FrontierMath Erdős 中的總解題數、標準化與非標準執行預算,或哪些結果被排除。若要報導這些細節,應以 Epoch 的特定結果表或評測報告為準,並一併列出預算與納入資格。
另有一項不同的 Epoch FrontierMath: Open Problems 成果:在發布前評測中,GPT-6 Astra 找到一條具有 648 個有理點的 genus-2 曲線。這是另一個基準的結果,不應與 FrontierMath Erdős 的分數混為一談。
43
token 定價不等於任務成本
OpenAI 列出的 GPT-6 Astra 定價為:每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。
19 提供的比較報導指出,Claude Fable 5.1 的輸入與輸出牌價相同,但快取輸入讀取為每百萬 token 0.25 美元,低於 Astra 的 1.00 美元。
4
這會導向兩種不同的成本問題:
- 長時間執行、反覆載入程式庫脈絡的 coding agent: 若工作負載能有效使用快取,較低的快取讀取價格可能明顯壓低成本。
- 成功完成任務的成本: 若模型能以較少輸出 token、工具呼叫、重試、操作步數或人工介入完成正確工作,它仍可能更便宜。
OpenAI 表示,Astra 在其部分評測中因使用大幅較少的輸出 token,而有較低的預估每任務 API 成本。
18 不過這屬於供應商公布的評測證據,不是適用所有工作流程的保證。只看基準分數與 token 單價,無法判定哪個模型在某個程式碼庫或代理流程中成本最低。
不被排行榜誤導的比較方式
在 Astra、Claude Fable 5.1 與 GPT-5.6 Sol 之間選擇前,建議先把比較條件拉齊:
- 先對齊工作負載。 程式庫維護、瀏覽器自動化、研究、形式化證明與文件工作,應分開評估。
- 固定推論政策。 盡量使用相近的推理強度、token 上限、工具權限與重試規則。
- 把模型能力與整合能力分開看。 同時呈現中立框架與供應商原生框架結果,不要混成一個排名。
- 以每美元成功率衡量。 追蹤正確完成數、延遲、重試、快取使用率與所需人工覆核,而非只比較輸入、輸出 token 單價。
- 保留不確定性。 當指數差距很小、設定持續變動或公開證據不完整時,結論應更謹慎。
Astra 在 ARC-AGI-3 Provider Adapter 下的表現確實醒目,標準框架的成績也很強;但這兩者都不會推翻另一項在不同任務組合與設定下偏好其他模型的獨立指數。最有用的問題始終是:這個被評估的設定,是否真的貼近系統要完成的工作?