Nvidia于8月24日宣布,面向低延迟AI推理的Groq 3 LPX已进入全面量产。在Artificial Analysis测试中,它运行Google开源Gemma 4 31B并处理10万个Token的上下文时,输出速度达到每秒3400个Token;Nvidia称其响应速度是最接近替代平台的4倍。[17][35] LPX不是用来取代Nvidia GPU的芯片,而是专门加速推理中的“解码”阶段,即模型逐个生成回复Token的过程。[19][34] Nebius是首个宣布采用LPX的AI云厂商,计划在2026年底前将其整合进Token Factory平台;Groq也将把LPX与Vera Rubin NVL72部署到自己的专用AI...
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full-production launch of its Groq 3 LPX dedicated AI-inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack-scale accelerator had entered full production as the low-latency, long-context inference component of the Vera Rubin platform. It is intended for rapid token gen. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Nvidia在8月24日举行的Hot Chips活动上宣布,Groq 3 LPX机架级推理加速器已进入全面量产。该系统将与Vera Rubin NVL72协同工作,重点提升决定交互式AI响应速度的Token生成环节。26
在Artificial Analysis的一项基准测试中,Groq 3 LPX运行Google开源的Gemma 4 31B模型,并处理10万个Token的上下文,输出速度达到每秒3400个Token。更精确地说,测试记录的中位数为每秒3431个输出Token;Nvidia在公告中将其四舍五入为3400。Nvidia称,在这一特定工作负载下,LPX的响应速度是最接近替代平台的4倍。1735
Groq 3 LPX面向需要低延迟推理的场景,包括智能代理、编程助手以及其他必须快速回应、同时还要处理长上下文的应用。Nvidia将其定位为一款能够以稳定、可预测的速度生成Token的交互式推理加速器。1926
理解LPX的关键,在于区分大语言模型推理的两个阶段:预填充(prefill)和解码(decode)。
LPX主要针对第二个阶段进行优化,让模型更快地“说出”答案。Vera Rubin NVL72则继续承担更通用的任务,包括训练、更广泛的推理、高吞吐量上下文处理,以及高并发服务。34
因此,Nvidia并不是要用LPX全面替代GPU,而是将不同工作负载分配给更合适的硬件:GPU负责通用的加速计算,源自Groq架构的LPX则负责对延迟最敏感的Token生成环节。
Artificial Analysis在Gemma 4 31B的10万Token上下文测试中,测得Groq 3 LPX的中位输出速度为每秒3431个Token。Nvidia在发布消息时将这一数字表述为每秒3400个Token。17
Nvidia进一步表示,在该测试场景中,LPX的响应速度比最接近的替代平台快4倍。35但这是一项针对特定模型、上下文长度和测试设置的性能主张,并不代表LPX在所有AI任务中都能取得同样结果。
这一点十分重要。Token生成速度只是推理体验的一部分。模型规模、提示词长度、并发请求数量、内存、网络,以及处理初始上下文所需的时间,都会影响真实应用中的响应表现。
换句话说,这项测试说明LPX在长上下文、低延迟生成场景中具有很强的潜力,但最终价值仍要看它接入云服务和实际应用后的整体表现。
Nebius是目前首个宣布采用Groq 3 LPX的AI云厂商。该公司计划在2026年底前,将LPX整合进生产级推理平台Nebius Token Factory。2
Groq也表示,自己将成为最早采用LPX的客户之一。Groq计划在其专门建设的AI推理云中,将LPX与Vera Rubin NVL72并行部署。两者的分工很清晰:Rubin系统提供更全面的平台能力,LPX则为处理长上下文的工作负载提升Token生成速度。18
这些部署将成为检验Nvidia基准成绩能否转化为广泛云端性能的下一步。
Nvidia已将Groq 3 LPX定位为Vera Rubin平台的第七个主要组成部分。该平台还包括Vera CPU等芯片;Nvidia称,Vera CPU搭载88个定制设计的Olympus核心。33
Vera CPU主要处理围绕模型推理展开的工作,包括任务编排、数据处理、工具调用和代码执行。Nvidia还宣布,SpaceXAI计划部署Vera CPU,用于下一代智能代理应用,并采用优化版Vera Rubin NVL72系统打造第一代Starmind AI卫星。40
这些产品共同体现了Nvidia对“AI工厂”的构想:不再把所有任务都当成GPU问题,而是使用不同类型的芯片处理不同环节。在这一架构中,CPU负责协调智能代理工作,GPU负责灵活的大规模计算,LPX则专注于快速且确定性更强的回复生成。
Groq 3 LPX是Nvidia在2025年12月与Groq达成20亿美元交易后最明确的产品成果之一。但将这笔交易简单称为“Nvidia收购Groq”并不准确。
现有报道显示,双方达成的是Groq推理技术的非独家许可协议,同时Nvidia聘用了Groq创始人兼首席执行官Jonathan Ross、总裁Sunny Madra以及其他关键员工。48
交易完成后,Groq仍继续运营,并随后获得了新的融资。这更符合一项围绕技术授权和人才引进的交易,而不是收购整个运营中的公司。3
这也解释了双方目前的产品关系:Nvidia将Groq的语言处理技术整合进自己的机架级平台,而Groq继续作为独立公司运营,并计划在其云服务中使用由Nvidia提供的相关硬件。
这次发布的重点不只是Nvidia又推出了一款AI芯片,而是它正在拆分AI服务交付的不同阶段,并把其中最影响交互延迟的部分交给专用加速器处理。
对于智能代理而言,更快的解码速度可能让多步骤任务显得更加即时。LPX在长上下文测试中的成绩显示了显著潜力,但真实收益仍取决于具体应用,以及整个推理服务栈的设计。
随着全面量产启动、Nebius开始部署,以及Groq计划将其用于自己的云服务,Groq 3 LPX将迎来比单次基准测试更有意义的考验:它能否把每秒3400个Token的测试优势,转化为用户真正感受到的、更快的AI服务。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Nvidia于8月24日宣布,面向低延迟AI推理的Groq 3 LPX已进入全面量产。在Artificial Analysis测试中,它运行Google开源Gemma 4 31B并处理10万个Token的上下文时,输出速度达到每秒3400个Token;Nvidia称其响应速度是最接近替代平台的4倍。[17][35]
Nvidia于8月24日宣布,面向低延迟AI推理的Groq 3 LPX已进入全面量产。在Artificial Analysis测试中,它运行Google开源Gemma 4 31B并处理10万个Token的上下文时,输出速度达到每秒3400个Token;Nvidia称其响应速度是最接近替代平台的4倍。[17][35] LPX不是用来取代Nvidia GPU的芯片,而是专门加速推理中的“解码”阶段,即模型逐个生成回复Token的过程。[19][34]
Nebius是首个宣布采用LPX的AI云厂商,计划在2026年底前将其整合进Token Factory平台;Groq也将把LPX与Vera Rubin NVL72部署到自己的专用AI推理云中。[2][18]