Tại Hot Chips ngày 24/8/2026, Nvidia công bố Groq 3 LPX đã bước vào sản xuất toàn diện và trở thành bộ tăng tốc suy luận độ trễ thấp cho nền tảng Vera Rubin. LPX tập trung vào khâu giải mã và tạo token nhanh trong các hệ thống AI tác vụ, bổ trợ cho Vera Rubin NVL72 thay vì thay thế GPU trong huấn luyện và các tác vụ...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Nvidia announce at Hot Chips 2026 about the full production launch of its Groq 3 LPX dedicated AI inference accelerator—acquired th. Article summary: At Hot Chips on August 24, Nvidia said its Groq 3 LPX rack scale accelerator had entered full production as the low latency, long context inference component of the Vera Rubin platform.. Topic tags: general web, openai, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnai
Tại sự kiện Hot Chips ngày 24/8/2026, Nvidia cho biết Groq 3 LPX — bộ tăng tốc suy luận AI quy mô rack — đã bước vào sản xuất toàn diện. Sản phẩm được thiết kế cho các hệ thống AI tác vụ, tức những mô hình có thể thực hiện chuỗi bước như lập kế hoạch, gọi công cụ hoặc xử lý các yêu cầu tương tác nhiều vòng.
LPX không phải là một GPU đa dụng mới. Vai trò chính của nó là tạo ra từng token tiếp theo với tốc độ nhanh và ổn định, đặc biệt khi mô hình phải xử lý ngữ cảnh rất dài. Trong kiến trúc Vera Rubin, LPX hoạt động cùng hệ thống Vera Rubin NVL72: các hệ thống Rubin đảm nhiệm phần tính toán AI tổng quát, huấn luyện, tiếp nhận ngữ cảnh và nhiều tác vụ suy luận; LPX tập trung vào khâu giải mã và phát token đầu ra. 36
Trong bài kiểm tra của Artificial Analysis, một hệ thống Groq 3 LPX do Nvidia vận hành đạt 3.431 token đầu ra mỗi giây khi chạy mô hình mã nguồn mở Gemma 4 31B với ngữ cảnh dài 100.000 token. Nvidia làm tròn kết quả này thành 3.400 token/giây trong thông báo của mình. 16
Theo Nvidia, kết quả này giúp LPX có độ phản hồi nhanh gấp 4 lần nền tảng thay thế gần nhất trong nhóm tác vụ dài ngữ cảnh và nhạy cảm với độ trễ. Đây là loại hiệu năng có thể ảnh hưởng trực tiếp đến cảm nhận của người dùng: AI càng nhanh chóng tạo câu trả lời hoặc hoàn tất từng bước, tác vụ tương tác càng ít bị gián đoạn. 6
Nvidia định vị Groq 3 LPX là mảnh ghép lớn thứ bảy của nền tảng Vera Rubin, bên cạnh CPU Vera và các chip khác. CPU Vera có 88 lõi Olympus do Nvidia thiết kế, tương thích đầy đủ với Arm. 2
Cách phân chia này cho thấy Nvidia đang hướng tới các “nhà máy AI” được tối ưu theo từng loại công việc. GPU Rubin và hệ thống Vera Rubin NVL72 vẫn là nền tảng linh hoạt cho tính toán AI quy mô lớn, trong khi LPX chuyên xử lý điểm nghẽn tạo token — yếu tố quyết định tốc độ phản hồi của các tác nhân AI trong những phiên làm việc dài và nhiều bước. 36
Nebius được Nvidia công bố là nhà cung cấp đám mây AI đầu tiên áp dụng LPX. Nebius dự kiến tích hợp bộ tăng tốc này vào nền tảng suy luận sản xuất Token Factory. 6
Groq cũng cho biết mình sẽ nằm trong nhóm những đơn vị áp dụng sớm, triển khai LPX cùng Vera Rubin NVL72 trên dịch vụ đám mây AI suy luận chuyên dụng của công ty. 4
Cách mô tả rằng Nvidia đã “mua Groq” chưa hoàn toàn chính xác. Các thông tin hiện có mô tả một thỏa thuận trị giá 20 tỷ USD để Nvidia cấp phép công nghệ Groq và tuyển dụng những nhân sự chủ chốt, trong đó có nhà sáng lập Jonathan Ross và Chủ tịch Sunny Madra, thay vì mua đứt toàn bộ công ty. Groq sau đó vẫn tiếp tục hoạt động và huy động thêm vốn. 5
Các tài liệu được cung cấp chưa đủ cơ sở để xác nhận những tuyên bố cụ thể về 256 chip trong mỗi rack, 500 MB SRAM tích hợp trên mỗi chip, quy trình sản xuất của Samsung so với GPU của TSMC, phản ứng cạnh tranh từ AMD hoặc Cerebras, hay chế độ 750 token/giây của OpenAI.
Tương tự, bằng chứng cho thấy SpaceXAI có kế hoạch triển khai CPU Vera cho các ứng dụng AI tác vụ, nhưng chưa xác nhận đầy đủ các chi tiết về thực thi công cụ, mô phỏng trên nhiều vệ tinh quỹ đạo hoặc phạm vi và thời điểm chính xác của kế hoạch này. 7
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Tại Hot Chips ngày 24/8/2026, Nvidia công bố Groq 3 LPX đã bước vào sản xuất toàn diện và trở thành bộ tăng tốc suy luận độ trễ thấp cho nền tảng Vera Rubin.
Tại Hot Chips ngày 24/8/2026, Nvidia công bố Groq 3 LPX đã bước vào sản xuất toàn diện và trở thành bộ tăng tốc suy luận độ trễ thấp cho nền tảng Vera Rubin. LPX tập trung vào khâu giải mã và tạo token nhanh trong các hệ thống AI tác vụ, bổ trợ cho Vera Rubin NVL72 thay vì thay thế GPU trong huấn luyện và các tác vụ suy luận tổng quát.
Trong bài kiểm tra của Artificial Analysis, LPX đạt 3.431 token đầu ra/giây khi chạy Gemma 4 31B với ngữ cảnh 100.000 token; Nvidia làm tròn con số này thành 3.400 token/giây.