英伟达于 8 月 24 日宣布,Groq 3 LPX 机架级加速器已进入全面生产阶段,成为 Vera Rubin 平台面向低延迟、长上下文推理的组件。[3][6] LPX 的定位是快速生成 token,服务于智能体 AI 的实时交互;它将与 Vera Rubin NVL72 协同,而不是取代 GPU 在训练和通用推理中的作用。[3][6] 在 Artificial Analysis 基准测试中,LPX 运行开源 Gemma 4 31B、处理 10 万 token 上下文时,达到每秒 3431 个输出 token。[1][6]
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full production launch of its Groq 3 LPX dedicated AI inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack scale accelerator had entered full production as the low latency, long context inference component of the Vera Rubin platform.. Topic tags: general web, openai, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnai
英伟达在 2026 年 8 月 24 日举行的 Hot Chips 会议上宣布,Groq 3 LPX 机架级 AI 推理加速器已进入全面生产阶段。该产品将作为 Vera Rubin 平台的一部分,专门处理低延迟、长上下文场景下的 token 生成,尤其面向需要持续多轮响应的智能体 AI 系统。36
Groq 3 LPX 并不是一款用来全面替代 GPU 的芯片。英伟达的设计思路是让不同硬件各司其职:Vera Rubin NVL72 继续承担训练、上下文处理以及更广泛的推理任务,而 LPX 专注于推理中的“解码”阶段——也就是尽快、稳定地生成下一个 token。36
这一区分对智能体 AI 尤其重要。智能体往往需要连续调用模型、工具和外部服务,用户感受到的快慢,很大程度上取决于模型生成回复的速度,而不仅是一次性处理输入的吞吐量。
英伟达表示,在 Artificial Analysis 的测试中,Groq 3 LPX 运行 Google 开源的 Gemma 4 31B 模型,并处理 100,000 个 token 的上下文时,达到了每秒 3,400 个输出 token。英伟达引用的更精确成绩为每秒 3,431 个输出 token。16
英伟达还称,在这类长上下文、对延迟敏感的工作负载中,LPX 的响应速度是最近替代平台的约 4 倍。6
英伟达将 LPX 定位为 Vera Rubin 平台的第七个主要芯片组件,与 Vera CPU 及平台中的其他处理器共同构成完整的 AI 基础设施。Vera CPU 配备 88 个英伟达自主设计的 Olympus 核心,并兼容 Arm 架构。2
从产品分工来看,Vera Rubin NVL72 更像是通用型、高吞吐量的 AI 计算平台;Groq 3 LPX 则是为交互式推理打造的专用加速层。两者结合后,英伟达希望同时覆盖大规模计算能力和实时响应需求。36
Nebius 将成为首个采用 Groq 3 LPX 的 AI 云厂商,并计划把它接入自己的 Token Factory 生产级推理平台。6
Groq 也表示将成为首批部署者之一,在其专门面向 AI 推理的云服务中,把 LPX 与 Vera Rubin NVL72 配套使用。4
英伟达释放出的信号是,下一代 AI“工厂”不会只依赖一种处理器,而会针对不同工作负载进行硬件分工:GPU 和 Rubin 系统负责灵活、规模化的 AI 计算,LPX 则专门处理影响智能体交互体验的 token 生成瓶颈。36
对于编程助手、企业智能体以及其他需要长上下文和连续多步推理的应用而言,这种架构的目标不是单纯提高峰值算力,而是让模型更快地产生可见结果,并在多轮操作中保持稳定响应。
将这笔交易直接称为英伟达“收购 Groq”并不完全准确。现有报道描述的是一项规模约 200 亿美元的技术授权与关键人员聘用协议,而不是对 Groq 公司的整体收购。Groq 随后仍保持运营,并完成了新一轮融资。5
这项安排包括授权 Groq 的推理技术,以及聘用其创始人 Jonathan Ross、总裁 Sunny Madra 和其他关键高管。因此,Groq 3 LPX 虽然带有 Groq 品牌和技术渊源,但不能简单等同于英伟达已经买下了 Groq 这家公司。
现有材料不足以充分证实以下具体硬件信息:每个机架包含 256 颗芯片、每颗芯片拥有 500 MB 片上 SRAM,以及三星代工与台积电 GPU 生产之间的对比。此外,关于 AMD、Cerebras 或 OpenAI 已作出特定竞争回应的说法,也缺乏足够证据支持。
同样,现有证据只能支持 SpaceXAI 计划部署面向智能体 AI 应用的 Vera CPU;关于其将如何执行工具调用、在轨道卫星之间进行仿真,以及部署的具体范围和时间,目前不能据此得出更详细的结论。7
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
英伟达于 8 月 24 日宣布,Groq 3 LPX 机架级加速器已进入全面生产阶段,成为 Vera Rubin 平台面向低延迟、长上下文推理的组件。[3][6]
英伟达于 8 月 24 日宣布,Groq 3 LPX 机架级加速器已进入全面生产阶段,成为 Vera Rubin 平台面向低延迟、长上下文推理的组件。[3][6] LPX 的定位是快速生成 token,服务于智能体 AI 的实时交互;它将与 Vera Rubin NVL72 协同,而不是取代 GPU 在训练和通用推理中的作用。[3][6]
在 Artificial Analysis 基准测试中,LPX 运行开源 Gemma 4 31B、处理 10 万 token 上下文时,达到每秒 3431 个输出 token。[1][6]