黄仁勋在 GPT-6 Astra 发布后写下“AGI 已到来”,更准确的理解是:他认为,Astra 已经具备足够广泛、足够强的推理和工具调用能力,因此跨过了他自己所采用的实用性 AGI 门槛。这不是一项已经被科学界或整个 AI 行业共同确认的结论。
他的论据有两部分:一是 Astra 在数学、抽象推理、编程和终端代理等评测中的亮眼成绩;二是支撑这些能力的英伟达超大规模计算基础设施。前者意味着模型能力确有明显推进,后者则也是对算力扩张必要性的强力背书。
黄仁勋具体说了什么?
黄仁勋在 X 上祝贺 OpenAI 时表示,GPT-6 Astra 使用“约 10 万+ NVIDIA Grace Blackwell NVLink72”训练;他称该模型在 FrontierMath Tier 4、ARC-AGI-3 和 TerminalBench-4.0 上达到领先水平,并写道:“400K GPUs coming online next”(接下来将有 40 万块 GPU 上线)。他还把从 ChatGPT、o1 到 Astra 的进展概括为只用了四年,继而断言:“AGI has arrived。”
13
这段话实际上包含两层判断:
- **能力判断:**Astra 在高难数学、抽象推理、编程与计算机操作等多类任务上表现强劲。
- **规模判断:**达到这一能力水平离不开极大规模的英伟达系统,后续新增算力还将继续推动能力提升。
不过,“约 10 万+ NVIDIA Grace Blackwell NVLink72”不应被直接简化为一个可审计的精确 GPU 总数。黄仁勋的公开帖文没有给出具体集群配置、训练时长、利用率或总训练算力,外界无法据此独立核验。另有报道称,他先前提及的 30 万 GPU 数字后来被修改,但黄仁勋和英伟达均未公开说明修改原因。
5
基准成绩为何重要,又为何不足以认证 AGI?
OpenAI 将 GPT-6 Astra 描述为其最强模型,面向高难度端到端任务,覆盖推理、编程、计算机使用、研究、浏览与文档生成。其开发者文档强调,模型可以在用户提供的上下文与工具支持下,把多步骤请求推进到完成的结果。
17
18
OpenAI 公布的代表性成绩包括:
- FrontierMath Tier 4:98%
- ARC-AGI-3:99.9%
- Terminal-Bench 4.0:57.9%
23
这些分数确实值得重视。FrontierMath Tier 4 面向高难数学评测;ARC-AGI-3 主要考察二维益智游戏中的抽象推理;Terminal-Bench 则衡量模型作为终端代理执行命令行任务的能力。它们共同覆盖了不止一种狭窄任务类型。
23
26
但这不等于“基准证明了 AGI”。在若干评测中取得高分,并不能自动证明系统能在陌生、模糊、不断变化或高风险的现实环境里,稳定地完成全部范围的人类智力工作。它同样无法独自回答几个关键问题:模型能否长期自主规划?环境变化时是否稳健?部署时需要多少人工监督?会以何种方式失效?
因此,更稳妥的结论是:Astra 的公开表现显著加强了这样一种判断——前沿模型已能完成覆盖面更广、复杂度更高、并且可借助工具执行的工作。 但这与 AGI 已被认证并不是一回事。
OpenAI 没有跟随宣称“AGI 已到来”
与黄仁勋相比,OpenAI 的表述更具体,也更克制。它称 Astra 是“最具能力的模型”、是面向复杂推理与编程的旗舰模型;文档列出函数调用、网络搜索、文件搜索和计算机使用等工具,并标明其上下文窗口为 105 万 token。
18
21
OpenAI 还表示,Astra 是首个在其 Preparedness Framework(准备度框架)下达到网络安全能力“Critical(关键)”阈值并被广泛部署的模型。
28
这些是重要的能力与安全声明,但 OpenAI 并未宣布 Astra 已是 AGI。二者差别很大:前者是在描述可观察、可评测的模型能力;后者则是在宣布一个定义仍有争议的概念门槛已经被跨越。
黄仁勋对 AGI 的说法正在不断加码
黄仁勋长期以来都强调,AGI 时间表取决于人们如何定义这个词。2024 年,他曾表示,AI 可能在五年内达到 AGI,但同时明确附带了“取决于定义”的限定。
50
到 2026 年 3 月,他在一场围绕 AI 能否创建和运营一家十亿美元公司展开的讨论中说:“我认为我们已经实现了 AGI。”
61 同年 8 月下旬,他又表示,英伟达“在许多任务上”可以说已经实现 AGI,同时也称这类里程碑“没有意义”。
54
所以,Astra 发布后的说法并非突如其来。黄仁勋使用的 AGI 更接近一种按任务和经济价值衡量的概念:如果一个系统能以很高水平完成足够广泛、具有实际价值的认知工作,它就可以被视为 AGI。这样的用法可以自洽,但不是唯一标准,更不是共同接受的科学标准。
为什么“AGI 已到来”仍有争议?
核心问题在于定义。即便是认为强大 AI 即将出现的业内领袖,也未必接受“AGI”是一个边界清晰的标签。Anthropic 首席执行官达里奥·阿莫代伊曾将 AGI 称为“营销术语”,认为它从未有过良好定义。
47
Google DeepMind 首席执行官德米斯·哈萨比斯则更为谨慎。他表示,通往人类水平 AGI 的道路仍存在“缺失的要素”,并估计这一目标可能还需要五到十年。
34
质疑黄仁勋判断的人也在强调类似问题:卓越的评测成绩,不等于已经证明模型拥有可靠的通用行动能力。一个模型即使擅长结构化评测,仍可能在目标含糊、环境变化、信息不完整或真实执行环节出现明显失误。
更有说服力的 AGI 证据,应包括跨大量新颖任务的可复现、独立验证,以及对可靠性、能力边界、所需监督和失效模式的清晰披露,而不能只依赖单一排行榜或高管的一次宣言。
英伟达的利益关系也是理解背景的一部分
黄仁勋的判断不能完全脱离英伟达在 AI 产业链中的位置。他在宣布“AGI 已到来”的同一段话中,强调了最新英伟达系统的训练作用,并预告更多 GPU 即将上线。
13
这并不意味着其能力判断必然错误,但意味着他并非独立评估者:前沿模型训练与部署规模越大,英伟达数据中心业务受益就越直接。因此,这种表述既是技术观点,也天然构成对算力基础设施需求的叙事。
英伟达与 OpenAI 还存在金融关系。2025 年 9 月,两家公司宣布,随着 OpenAI 推进基于英伟达系统的数据中心建设,英伟达计划最多投资 1,000 亿美元。
62 到 2026 年 3 月,黄仁勋表示,由于 OpenAI 预计上市,这笔 1,000 亿美元的投资机会可能已不再存在;路透社报道称,英伟达已完成对 OpenAI 的 300 亿美元投资。
49
这种商业与资本层面的绑定,意味着外界应更谨慎审视黄仁勋的措辞;但它本身并不足以否定 Astra 所报告的技术进展。
结论:这是重要判断,不是既定事实
黄仁勋的意思是,按照他以实际任务能力为中心的 AGI 定义,GPT-6 Astra 已跨过了门槛:它把强推理、编程、研究、浏览和计算机操作结合起来,而背后是大规模英伟达基础设施的支撑。
现有资料支持一个更窄、也更稳妥的判断:Astra 看起来是广泛工具型 AI 的一次重要跃升,并在多项高难评测中取得突出成绩。
23 但 OpenAI 没有宣称 AGI 已实现;AGI 也没有获得普遍接受的科学定义或确认流程;基准成绩本身更不能证明系统在所有真实世界场景中都具备稳健、可靠的通用智能。
因此,“AGI 已到来”应被视为黄仁勋对一次重大模型发布作出的、影响很大的诠释,而不是 AI 领域已经盖棺定论的事实。