NVIDIA 在 2026 年 8 月 24 日的 Hot Chips 活動上宣布,Groq 3 LPX 機架級 AI 推理加速器已進入全面量產。這款產品是 Vera Rubin 平台的一部分,定位不是取代 GPU,而是專門處理代理式 AI(agentic AI)最在意的環節:以低延遲、穩定速度產生下一個 Token。 36
NVIDIA 宣布了什麼?
NVIDIA 表示,Groq 3 LPX 已正式從產品展示階段進入全面量產,並將作為 Vera Rubin 平台的低延遲、長上下文推理元件。對需要多輪思考、持續呼叫工具或即時回應的 AI 代理而言,Token 產生速度會直接影響使用者感受到的反應快慢。 36
在 Artificial Analysis 的基準測試中,LPX 執行 Google 開源的 Gemma 4 31B 模型,搭配 100,000 個 Token 的上下文,測得每秒 3,431 個輸出 Token。NVIDIA 在公告中將這項成績概括為每秒 3,400 個輸出 Token。 16
NVIDIA 進一步宣稱,在這類長上下文、對延遲敏感的工作負載上,LPX 的回應速度約為最接近替代平台的四倍。不過,這是 NVIDIA 根據特定測試條件提出的比較,並不代表所有模型、服務或應用情境都能取得相同差距。 6
LPX 和 Vera Rubin NVL72 如何分工?
簡單來說,Vera Rubin NVL72 是較具彈性的通用 AI 平台,能處理訓練、上下文讀取與前置計算(prefill),也能支援大規模推理服務;Groq 3 LPX 則把資源集中在解碼與生成(decode)階段,也就是快速且可預測地逐一產生後續 Token。 36
這種分工反映 NVIDIA 對「AI 工廠」的設想:不同晶片按照工作負載各司其職,而不是讓單一 GPU 處理所有任務。NVIDIA 將 LPX 定位為 Vera Rubin 平台的第七個主要晶片元件,與 Vera CPU 及平台其他晶片並列;Vera CPU 採用 88 個客製化 Olympus 核心。 2
首批採用者與部署時間
Nebius 被 NVIDIA 宣布為首個採用 Groq 3 LPX 的 AI 雲端業者,計畫把 LPX 加入其 Token Factory 生產推理平台。 6
Groq 也表示自己將成為首批採用者之一,在專為 AI 推理打造的雲端中,讓 LPX 與 Vera Rubin NVL72 並行部署。 4
目前可由資料確認的時間點,是 NVIDIA 於 8 月 24 日在 Hot Chips 公布「進入全面量產」;現有證據並未提供 Hot Chips 活動的具體場地,也不足以把全面量產等同於所有客戶已在同一天取得產品。
這和 NVIDIA 與 Groq 的交易有何關係?
將這件事描述成 NVIDIA「收購 Groq」並不完全準確。現有報導指出,雙方的安排是涉及約 200 億美元的技術授權與關鍵人才加入 NVIDIA,包括 Groq 創辦人 Jonathan Ross 及總裁 Sunny Madra,而非 Groq 公司整體被 NVIDIA 直接收購;之後 Groq 仍持續營運並完成新一輪融資。 516
因此,Groq 3 LPX 的推出更適合被理解為:NVIDIA 將 Groq 的推理技術與人才納入自身 AI 平台策略,再把這項能力整合進 Vera Rubin 的機架級系統。
目前不宜過度解讀的部分
提供的資料不足以證實部分更細節的硬體說法,包括每個機架搭載 256 顆晶片、每顆晶片擁有 500 MB 片上 SRAM,以及 Samsung 生產 LPX、TSMC 生產 NVIDIA GPU 等說法;同樣也沒有充分證據支持 AMD、Cerebras 或 OpenAI 對此產品作出的特定競爭性回應。
此外,資料支持 SpaceXAI 計畫部署 Vera CPU 以支援代理式 AI 應用,但不足以確認其工具執行、軌道衛星模擬,或部署規模與時間表等更具體描述。 7