Nvidia於8月24日在Hot Chips宣布Groq 3 LPX正式投產;Artificial Analysis測試顯示,它在Gemma 4 31B配合100,000個Token上下文時,達到每秒3,400個輸出Token,Nvidia聲稱比最接近的平台快4倍。[17][35] LPX並非取代Nvidia GPU,而是專門處理AI推理中的Decode階段,即模型逐個Token生成答案的部分。 Nebius是首個公布的AI雲端採用者,計劃在2026年底前把LPX整合到Token Factory;Groq亦會在自己的AI推理雲,將LPX與Vera Rubin NVL72配合使用。[2][18]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full-production launch of its Groq 3 LPX dedicated AI-inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack-scale accelerator had entered full production as the low-latency, long-context inference component of the Vera Rubin platform. It is intended for rapid token gen. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Nvidia於8月24日在Hot Chips宣布,源自Groq技術的Groq 3 LPX機櫃式AI推理加速器已正式投產。這套系統會與Vera Rubin NVL72並用,針對最影響互動體驗的部分——模型生成答案時的Token輸出速度——加速處理。26
在Artificial Analysis一項測試中,Groq 3 LPX運行Google開源的Gemma 4 31B模型,並處理100,000個Token的上下文,錄得每秒3,400個輸出Token。較精確的中位數數字為每秒3,431個Token;Nvidia在公布時將數字約整為3,400。公司表示,在這個特定工作負載下,LPX的回應速度是最接近替代平台的4倍。1735
AI模型推理大致可分為兩個階段:
Groq 3 LPX主要針對第二個階段,提供低延遲、速度較穩定的Token生成,適合代理式AI、編程助手,以及需要一邊處理大量上下文、一邊快速回應的互動應用。1926
相比之下,Vera Rubin NVL72仍然是較靈活的通用平台,可應付模型訓練、更廣泛的推理工作、高吞吐量服務,以及長上下文的處理。換句話說,LPX不是要取代GPU,而是與GPU分工:Rubin GPU處理較廣泛的運算,Groq架構則集中處理對延遲特別敏感的答案生成部分。34
在Artificial Analysis的100K上下文基準測試中,Gemma 4 31B於Groq 3 LPX上的中位輸出速度為每秒3,431個Token,Nvidia公布時以每秒3,400個Token概括。17
Nvidia將這個結果形容為比最接近的替代平台快4倍。35不過,這是針對指定模型、上下文長度及測試設定的比較,並不代表LPX在所有AI應用或所有模型中都必然快4倍。
實際使用時,模型大小、提示長度、同時處理的用戶數量、記憶體、網絡,以及首次讀取上下文所需時間,都會影響整體體驗。Token生成速度固然重要,但並非衡量推理系統表現的唯一指標。
AI雲端服務商Nebius是目前首個公布的採用者。公司計劃在2026年底前,把Groq 3 LPX整合到生產級推理平台Nebius Token Factory。2
Groq亦表示會成為首批採用者之一,在自家打造的AI推理雲中,將LPX與Vera Rubin NVL72一同部署。預期分工是由Rubin系統提供較全面的平台能力,再由LPX提升長上下文工作負載的Token生成速度。18
Nvidia將Groq 3 LPX定位為Vera Rubin平台的第七個主要組件。平台亦包括Vera CPU;Nvidia表示,Vera CPU採用88個自家設計的Olympus核心。33
Vera CPU針對的是模型推理周邊的工作,例如代理協調、資料處理、工具使用及程式碼執行。Nvidia同日表示,SpaceXAI計劃部署Vera CPU,支援新一代代理式AI應用;此外,SpaceXAI亦計劃以優化版Vera Rubin NVL72系統,支援第一代Starmind AI衛星。40
這些安排反映Nvidia所推動的「AI工廠」方向:不再假設所有工作都應由GPU包辦,而是按照工作性質分配硬件。CPU負責協調代理工作,GPU負責彈性較高的大規模運算,LPX則專注於快速而可預測的回覆生成。
Groq 3 LPX是Nvidia與Groq於2025年12月達成、涉及約200億美元交易後最清晰的產品成果之一。不過,將這宗交易直接稱為「Nvidia收購Groq」並不完全準確。
現有報道指,交易包括Groq推理技術的非獨家授權,以及Nvidia聘用Groq創辦人兼行政總裁Jonathan Ross、總裁Sunny Madra和其他核心員工。48
Groq在交易後仍然繼續營運,並在其後籌得額外資金,較符合「技術授權加人才招聘」的交易模式,而非買下整間仍在運作的公司。3
這個結構亦解釋了LPX的定位:Nvidia把Groq的語言處理技術融入自己的機櫃式平台;Groq則維持獨立營運,並計劃在自家雲端採用相關Nvidia硬件。
這次發布的重點,不只是Nvidia多了一款AI晶片,而是公司正把AI服務拆成不同階段,再將最講求低延遲的Token生成工作交給專用加速器。
對代理式AI而言,Decode更快,意味着多步驟任務可以更快逐步回應,使用者亦較少感到系統「諗緊」。不過,3,400個Token每秒仍然是特定長上下文測試中的成績;LPX能否將這項優勢轉化為普遍可用的雲端效能,最終仍要看Nebius的部署、Groq的採用,以及整個推理服務堆疊在真實應用中的表現。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Nvidia於8月24日在Hot Chips宣布Groq 3 LPX正式投產;Artificial Analysis測試顯示,它在Gemma 4 31B配合100,000個Token上下文時,達到每秒3,400個輸出Token,Nvidia聲稱比最接近的平台快4倍。[17][35]
Nvidia於8月24日在Hot Chips宣布Groq 3 LPX正式投產;Artificial Analysis測試顯示,它在Gemma 4 31B配合100,000個Token上下文時,達到每秒3,400個輸出Token,Nvidia聲稱比最接近的平台快4倍。[17][35] LPX並非取代Nvidia GPU,而是專門處理AI推理中的Decode階段,即模型逐個Token生成答案的部分。
Nebius是首個公布的AI雲端採用者,計劃在2026年底前把LPX整合到Token Factory;Groq亦會在自己的AI推理雲,將LPX與Vera Rubin NVL72配合使用。[2][18]