黃仁勳所說的「AGI 已經到來」,最適合解讀為他對 AI 能力與大規模運算基礎設施所作的強勢判斷,而不是 GPT-6 Astra 已被科學界一致認定為「人類等級通用人工智慧」的正式結論。
他的論點有兩個支柱:一是 Astra 在推理與代理式工作相關評測上的亮眼成績;二是他所稱、由輝達硬體支撐的龐大訓練與部署規模。兩者都值得重視,但都不能單獨構成 AGI 的公認認證。
黃仁勳實際說了什麼?
黃仁勳在 X 上祝賀 OpenAI 時表示,GPT-6 Astra 是在「~100K+ NVIDIA Grace Blackwell NVLink72」上訓練;他也稱其在 FrontierMath Tier 4、ARC-AGI-3 與 TerminalBench-4.0 屬於最先進水準,並寫道:「400K GPUs coming online next(接下來將有 40 萬顆 GPU 上線)。」他把 ChatGPT、o1 到 Astra 的進展濃縮為四年,最後下了「AGI has arrived」的結論。
13
這段話其實同時包含兩項主張:
- 能力主張: Astra 在高階數學、抽象推理、程式設計及電腦操作工作流程等多類任務上表現強勁。
- 規模主張: 要達到這樣的能力,超大規模的輝達系統至關重要;而未來新增的運算容量還會推動下一階段發展。
不過,「~100K+ NVIDIA Grace Blackwell NVLink72」不宜直接簡化為一個精確的 GPU 總數。黃仁勳的貼文沒有交代系統配置、訓練時間、使用率或總訓練算力,外界無從據此獨立核算。至於先前曾提及 30 萬顆 GPU、其後修改的報導,黃仁勳與輝達也尚未公開說明修訂原因。
5
基準成績很驚人,但不是 AGI 證書
OpenAI 將 GPT-6 Astra 定位為最能處理困難端到端工作的模型,涵蓋推理、寫程式、電腦操作、研究、瀏覽與文件製作。其開發者文件強調,模型可利用使用者提供的脈絡與工具,把多步驟任務從初始需求推進到完成結果。
17
18
OpenAI 的發布資料列出以下成績:
- FrontierMath Tier 4:98%
- ARC-AGI-3:99.9%
- Terminal-Bench 4.0:57.9%
23
這些結果指向顯著進步。FrontierMath Tier 4 被定位為高難度數學評測;ARC-AGI-3 是以 2D 解謎遊戲形式測量抽象推理;Terminal-Bench 則評估模型作為代理人在命令列與終端機環境中的表現。三者確實不只涵蓋單一、狹窄的任務類型。
23
26
但在一組評測中獲得高分,不會自動證明系統能可靠處理所有陌生、高風險或混亂的現實情境;它也無法解答模型在超長任務鏈、自主性、環境變動下的穩健度,以及部署時需要多少人類監督等問題。
因此,較精確的說法不是「基準證明了 AGI」,而是:Astra 的公布表現大幅強化了前沿模型能執行廣泛、複雜且能使用工具的工作的論點。
OpenAI 並沒有宣告 AGI
OpenAI 的措辭明顯較具體、也較克制。它稱 Astra 為「最有能力的模型」,並把它定位為複雜推理與程式設計的旗艦模型。官方文件列出的工具包括函式呼叫、網路搜尋、檔案搜尋與電腦操作,內容視窗為 105 萬個 token。
18
21
OpenAI 也表示,Astra 是首個在其「準備度框架」中達到網路安全能力 Critical(關鍵) 門檻、並被廣泛部署的模型。
28
這些都是重要的能力與安全聲明,但 OpenAI 並未說 Astra 已是 AGI。描述可衡量能力,與宣告跨越一條仍具爭議的概念門檻,是兩回事。
黃仁勳的 AGI 說法一路加強
黃仁勳長期以來都把 AGI 時程與「如何定義 AGI」綁在一起。2024 年,他曾說 AI 可能在五年內達到 AGI,但同時保留定義上的前提。
50
到了 2026 年 3 月,他在一段以「AI 能否建立並經營一家 10 億美元公司」為背景的討論中說:「我認為我們已經實現 AGI。」
61 8 月下旬,他又表示,對「許多任務」而言,輝達可以說已達到 AGI,同時卻稱這類里程碑「沒有意義」。
54
所以,Astra 的說法並非孤立事件,而是一條脈絡的延續:黃仁勳採取的是偏實用、任務導向的 AGI 定義。按照這種觀點,只要 AI 能以高水準完成夠廣泛、具經濟價值的認知工作,就可稱為 AGI。這種用法可以辯護,但並非唯一標準,更不是研究界共享的科學定義。
為何「AGI 已到」仍有爭議?
核心問題在於定義。即使是預期強大 AI 很快出現的業界領袖,對「AGI」是否是有用且明確的標籤也有分歧。Anthropic 執行長 Dario Amodei 曾把 AGI 形容為「行銷術語」,而非界定清楚的門檻。
47
Google DeepMind 執行長 Demis Hassabis 則更為謹慎,表示人類等級 AGI 仍有「缺失的要素」,並估計可能還要五到十年。
34
對黃仁勳宣告的質疑,也指向同一件事:優秀的基準表現,並不等於可靠的通用代理能力。模型即使在結構化評測中出色,面對目標模糊、環境持續變化、資訊不完整或需要真正落地執行的情境,仍可能失敗。
更有說服力的 AGI 證據,必須包括可重現、獨立驗證的跨領域新任務表現,以及對可靠性、限制、所需人類監督與失效模式的清楚說明;而不只是單一排行榜成績或高階主管的一句宣告。
輝達的商業利益也是理解脈絡的一部分
黃仁勳的看法不能完全脫離輝達在 AI 經濟中的位置。他在 Astra 貼文中,一面宣布 AGI 到來,一面直接背書輝達最新系統,並預告更多 GPU 容量即將上線。
13
這不表示能力主張必然不實,但意味著他不是獨立評估者:前沿模型訓練與部署需求越大,越直接支持輝達的資料中心業務。
輝達與 OpenAI 也有財務關係。兩家公司在 2025 年 9 月宣布,輝達計畫最高投資 1,000 億美元,配合 OpenAI 以輝達系統擴建資料中心。
62 到 2026 年 3 月,黃仁勳表示,因 OpenAI 預計上市,這項 1,000 億美元投資機會可能已不可行;路透社則報導,輝達已完成對 OpenAI 的 300 億美元投資。
49
這種商業與財務上的一致性,正是應審慎檢視其措辭的理由;但它本身不是否定 Astra 所公布進展的理由。
結論:是重要判斷,不是已定論的事實
黃仁勳的意思是:按他採取的實用定義,GPT-6 Astra 已跨過 AGI 的界線——它把推理、程式設計、研究、瀏覽與電腦操作能力整合在一起,並由龐大的輝達運算基礎設施支撐。
現有資料支持一個較收斂的結論:Astra 看來是廣泛、可使用工具的 AI 的重大進展,在多項高難度基準上公布了極亮眼的成績。
23 不過,OpenAI 沒有宣告 AGI;AGI 也不存在全球一致認可的科學定義或確認程序;而基準成功本身,尚不足以證明它能在每一種現實環境中展現穩健、可靠的通用智能。
因此,「AGI 已經到來」最好被視為黃仁勳對一次重大模型發布所作、影響力很大的詮釋,而不是 AI 領域已經確立的結論。