同一批新闻标题,能把 GPT-6 Astra 写成“遥遥领先”“不相上下”甚至“落后”。这看似矛盾,实则主要是评测方法不同:综合榜单、交互式智能体测试、形式化数学证明基准和 API 价格,测量的根本不是同一件事。
对实际使用者而言,结论并不是“其中一个结果必然错了”,而是:只要不说明任务类型和评测设置,就不存在放之四海而皆准的模型总排名。
榜单分数不是单一的“智力仪表盘”
综合指数会把多类任务合并为一个分数。最终排名取决于纳入了哪些任务、每类任务权重多高、测试了模型的哪种配置,以及如何处理推理强度、工具调用和成本等因素。一个在能力覆盖面较广的模型,可以在某个综合榜单领先,却在偏重编程或智能体执行的指数中落后。
这也意味着,分数对时间和配置高度敏感。例如,现有 Artificial Analysis 对比页面列出 GPT-6 Astra(max)为 55 分、Claude Fable 5.1 为 57 分;这并不是一些较早对比文章中出现的 61 分与 66 分。
3 这类差异提醒我们:记录评测日期和准确配置,比把某次快照当作永久排名更重要。
至于“Epoch AI 的 169 分能力指数、在 267 个模型中排名第一”的说法,现有 Epoch 一手资料并未提供足以核实的榜单和方法细节。在没有底层排行榜、基准权重、模型设置及不确定性信息前,不宜把它作为决定性比较依据。
ARC-AGI-3:测试接口一变,结果也会变
ARC-AGI-3 是交互式基准,并非让模型回答一套静态题目。智能体需要探索陌生环境、动态获得目标、建立可调整的世界模型,并根据经验修改策略。
50
ARC Prize 在其 Semi-Private 测试中公布了 GPT-6 Astra 的两项突出成绩:
| 评测条件 |
最佳公布得分 |
公布的单次运行成本 |
| Standard harness(标准接口),最高推理强度 |
62.7% |
26,098 美元 |
| OpenAI Provider Adapter(供应商适配器),高推理强度 |
99.9% |
18,817 美元,约 1.9 万美元 |
51
52
差距绝非无关紧要的技术细节。标准接口使用最小化、供应商中立的交互方式;模型只能保留自己明确选择带入后续环境的笔记。相对地,Provider Adapter 可在请求之间保留供应商的非透明推理状态,并通过上下文压缩支持更长的对话。
51
53
因此,Provider Adapter 的成绩衡量的是 Astra 连同 OpenAI 原生上下文管理集成后的表现。这是有实际产品价值的能力,但不能自动与仅通过中立接口测试的模型直接横比。ARC Prize 也明确表示,两种接口回答的是不同问题,应被视为不同评测条件。
53
ARC Prize 还称,Astra 在 96% 的关卡中使用的动作数少于受测人类的中位数。
52 这是“动作效率”结果,不等于模型在所有类型的工作上都全面优于人类;更不能替代对真实流程中的任务完成率、可靠性和总成本的比较。
FrontierMath Erdős 能证明什么,不能证明什么
FrontierMath Erdős 包含 68 道截至 2026 年 8 月仍未解决的 Erdős 问题。系统必须在 Lean 证明助手中证明或证伪猜想,因此提交的证明可以被机器形式化验证。
33
37
这种设计使它在“形式化数学正确性”方面格外严格。但数学基准上的成绩,不能直接变成编程、智能体执行或通用推理的总排名。它测量的是:在规定预算下,系统完成一项狭窄但极具挑战性的形式化证明任务的能力。
现有一手资料并未足以核实 Astra 在 FrontierMath Erdős 中解决问题的总数、标准化与非标准运行预算的区分,或哪些结果被排除在评测之外。此类细节应以 Epoch 的具体结果表或评测报告为准,并同时标明预算和纳入资格。
另有 Epoch 的 FrontierMath: Open Problems 页面记载:Astra 在一次预发布评测中找到了一条拥有 648 个有理点的 genus-2 曲线。这是另一项数学开放问题基准的结果,不应与 FrontierMath Erdős 的分数混为一谈。
43
Token 单价不等于完成任务的成本
OpenAI 列出的 GPT-6 Astra API 价格是:每百万输入 token 10 美元、每百万输出 token 50 美元。
19 所提供的对比报道显示,Claude Fable 5.1 的输入和输出标价相同;但缓存输入读取价格为每百万 token 0.25 美元,低于 Astra 的 1.00 美元。
4
由此会出现两种不同的成本问题:
- **长期运行的编程智能体、反复读取代码仓库上下文:**如果工作负载确实能有效利用缓存,较低的缓存读取价格可能显著降低成本。
- **每个已完成任务的成本:**若一个模型能以更少的输出 token、工具调用、重试次数、动作数或人工介入完成正确任务,它仍可能更便宜。
OpenAI 表示,Astra 在其若干评测中通过显著减少输出 token,实现了更低的单任务预估 API 成本。
18 但这属于厂商报告的证据,不是普遍保证。单个基准分数和 token 标价本身,无法证明哪个模型在某个特定代码库或智能体工作流中一定更省钱。
不被榜单带偏:模型比较的实用方法
在 Astra、Claude Fable 5.1 与 GPT-5.6 Sol 之间做选择前,先定义任务,并统一比较条件:
- **匹配工作负载。**代码仓库维护、浏览器自动化、研究检索、形式化证明和文档处理,应分别测试。
- **固定推理策略。**尽量使用可比的推理强度、token 上限、工具权限和重试规则。
- **区分模型能力与集成能力。**中立接口的成绩应与供应商原生接口的成绩并列呈现,而非混成一个排名。
- **衡量“成功一单多少钱”。**追踪正确完成数、延迟、重试、缓存命中和所需人工复核,而不仅是输入、输出 token 单价。
- **保留不确定性。**当指数差距很小、配置持续变化或公开证据不完整时,结论应更谨慎。
Astra 在 ARC-AGI-3 Provider Adapter 下的结果确实醒目,而其标准接口成绩也很强;但这两项结果都不会推翻另一套任务组合和配置下、可能更偏向其他模型的独立指数。真正有用的问题不是“哪个模型赢了”,而是:哪一种经过评测的配置,最接近你的系统实际必须完成的工作?