Nvidia 於 8 月 24 日宣布 Groq 3 LPX 進入全面量產;Artificial Analysis 測試顯示,它在 Gemma 4 31B 搭配 100,000 token 上下文時,達到每秒 3,400 個輸出 tokens,Nvidia 稱較最接近的平台快 4 倍。[17][26][35] LPX 並非用來取代 Nvidia GPU,而是專門加速推理中的 decode 階段,也就是模型逐一產生回覆 tokens 的過程。 Nebius 是目前公布的首個 AI 雲端採用者,計畫在 2026 年底前將 LPX 整合至 Token Factory;Groq 也計畫把它與 Vera Rubin NVL72 一同部署...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full-production launch of its Groq 3 LPX dedicated AI-inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack-scale accelerator had entered full production as the low-latency, long-context inference component of the Vera Rubin platform. It is intended for rapid token gen. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Nvidia 在 8 月 24 日於 Hot Chips 宣布,Groq 3 LPX 這款機架級 AI 推理加速器已進入全面量產。它不是另一套取代 GPU 的通用運算平台,而是設計來與 Vera Rubin NVL72 協同工作,專門提升互動式 AI 產生回覆時的速度。26
在 Artificial Analysis 的測試中,Groq 3 LPX 執行 Google 開源模型 Gemma 4 31B,並處理 100,000-token 上下文時,達到每秒 3,431 個輸出 tokens;Nvidia 在公告中將數字約整為每秒 3,400 個 tokens。17 Nvidia 表示,在這項特定工作負載下,LPX 的回應速度是最接近替代平台的 4 倍。35
要理解這項產品的定位,先要分清 AI 推理的兩個階段:prefill 與 decode。
LPX 的重點在第二階段。對 AI 代理、程式設計助理,以及需要處理長上下文的互動式服務而言,decode 速度會直接影響使用者感受到的回應是否即時。1926
相較之下,Vera Rubin NVL72 仍是較具彈性的通用平台,可處理訓練、更廣泛的推理工作,以及高吞吐量的上下文處理。Nvidia 的產品分工因此相當清楚:Rubin GPU 負責彈性與大規模運算,Groq 衍生的 LPX 則處理對延遲敏感的 token 生成。34
換句話說,Nvidia 並不是把 GPU 從 AI 伺服器中撤下,而是把模型服務流程拆開,讓不同硬體各自負責最適合的工作。
Artificial Analysis 在 Gemma 4 31B 的 100K-context 測試中,測得的中位輸出速度為每秒 3,431 個 tokens;Nvidia 在對外發布時採用每秒 3,400 個 tokens 的說法。17
這是一項針對特定模型、上下文長度和測試環境的結果,不應解讀為所有 AI 模型或所有應用都能達到同樣速度。Nvidia 所稱的「4 倍」優勢,同樣只適用於該測試情境。35
實際服務的體驗還會受到模型規模、提示長度、同時請求數、記憶體、網路,以及處理初始上下文所需時間影響。token 生成速度很重要,但並不是推理系統效能的全部。
Nebius 是目前公布的首個 AI 雲端採用者。該公司計畫在 2026 年底前,將 Groq 3 LPX 整合至 Nebius Token Factory——一套面向生產環境的 AI 推理平台。2
Groq 也表示自己將成為最早一批採用者之一,計畫在其專為 AI 推理打造的雲端服務中,讓 LPX 與 Vera Rubin NVL72 並行部署。18 這種組合的目標是由 Rubin 系統提供較廣泛的平台能力,再由 LPX 加快長上下文工作負載的回覆生成。
Nvidia 將 Groq 3 LPX 定位為 Vera Rubin 平台的第七個主要元件。平台另一項核心產品是 Vera CPU;Nvidia 表示,Vera CPU 配備 88 個自行設計的 Olympus 核心。33
Vera CPU 負責模型推理周邊的工作,例如資料處理、工作流程協調、工具使用與程式碼執行。Nvidia 同日也宣布,SpaceXAI 計畫部署 Vera CPU,以支援下一代 AI 代理應用,並使用最佳化的 Vera Rubin NVL72 系統打造第一代 Starmind AI 衛星。40
這些產品共同呈現出 Nvidia 所謂「AI 工廠」的方向:不再把每一種工作都交給 GPU,而是以專用元件分工。CPU 協調代理工作,GPU 執行彈性的大規模運算,LPX 則聚焦於快速且可預期的回覆生成。
Groq 3 LPX 是 Nvidia 在 2025 年 12 月與 Groq 達成交易後,最明確的產品成果之一。不過,將這筆交易簡化為「Nvidia 收購 Groq」並不精確。
現有報導指出,雙方安排是 Groq 推理技術的非獨家授權,加上 Nvidia 延攬 Groq 創辦人兼執行長 Jonathan Ross、總裁 Sunny Madra 及其他關鍵員工。48 Groq 在交易後仍持續營運,之後也取得額外融資,這更接近技術與人才交易,而非買下整間營運中的公司。3
這種結構也解釋了 LPX 的產品定位:Nvidia 將 Groq 的語言處理技術融入自己的機架級平台;另一方面,Groq 仍以獨立公司身分運作,並計畫在自家雲端採用由 Nvidia 打造的相關硬體。
這次發布的重點不只是 Nvidia 多了一款 AI 晶片,而是它開始把 AI 服務流程中的不同階段拆分,再將最需要低延遲的部分交給專用加速器。
對需要多步驟執行任務的 AI 代理而言,更快的 decode 可能讓整體互動感受更順暢。LPX 在長上下文測試中的成績顯示出明顯潛力,但它能否把單一基準測試的優勢,轉化為廣泛可用的雲端效能,仍要看實際應用、完整服務架構,以及 Nebius 和 Groq 後續部署的結果。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Nvidia 於 8 月 24 日宣布 Groq 3 LPX 進入全面量產;Artificial Analysis 測試顯示,它在 Gemma 4 31B 搭配 100,000 token 上下文時,達到每秒 3,400 個輸出 tokens,Nvidia 稱較最接近的平台快 4 倍。[17][26][35]
Nvidia 於 8 月 24 日宣布 Groq 3 LPX 進入全面量產;Artificial Analysis 測試顯示,它在 Gemma 4 31B 搭配 100,000 token 上下文時,達到每秒 3,400 個輸出 tokens,Nvidia 稱較最接近的平台快 4 倍。[17][26][35] LPX 並非用來取代 Nvidia GPU,而是專門加速推理中的 decode 階段,也就是模型逐一產生回覆 tokens 的過程。
Nebius 是目前公布的首個 AI 雲端採用者,計畫在 2026 年底前將 LPX 整合至 Token Factory;Groq 也計畫把它與 Vera Rubin NVL72 一同部署於自有 AI 推理雲。[2][18]