Thông điệp trọng tâm của Nvidia là đánh giá AI factory bằng số token tác tử đã được kiểm chứng trên mỗi megawatt, thay vì chỉ nhìn hiệu năng tính toán đỉnh. Lambda cho biết DSX MaxLPS giúp cụm HGX B200 tăng 24% thông lượng token và 23% hiệu năng trên mỗi watt trong cùng ngân sách điện.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Nvidia present on the opening day of its AI Infra Summit about transforming AI factories from systems optimized primarily for raw p. Article summary: Nvidia’s opening-day message was that an AI factory should be measured not only by peak compute, but by validated agentic tokens produced per megawatt—requiring integrated design across silicon, systems, networking, soft. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Điểm nghẽn của hạ tầng AI ngày càng không chỉ là số lượng bộ tăng tốc có thể lắp vào tủ máy chủ, mà là lượng điện một cơ sở thực sự nhận được. Trong ngày khai mạc AI Infra Summit 2026 tại Santa Clara, Nvidia đưa ra một thước đo khác cho “AI factory”: số token tác tử trên mỗi megawatt điện — tức lượng công việc suy luận hữu ích mà hệ thống tạo ra trong giới hạn điện năng. 2
3
Ian Buck, Phó chủ tịch phụ trách hyperscale và điện toán hiệu năng cao của Nvidia, trình bày định hướng này như một bài toán đồng bộ từ GPU, mạng, phần mềm suy luận, làm mát và điều khiển điện năng cho tới cách trung tâm dữ liệu phản ứng với lưới điện. Theo lập luận của Nvidia, hiệu năng GPU đơn lẻ vẫn quan trọng, nhưng không còn đủ để quyết định hiệu quả kinh tế của một AI factory. 1
2
3
Dữ liệu cụ thể nhất tại sự kiện đến từ Lambda, nhà cung cấp đám mây AI đã thực hiện lần kiểm chứng đầu tiên trong môi trường triển khai đối với Nvidia DSX MaxLPS trên máy chủ GPU HGX B200. Nvidia cho biết DSX MaxLPS theo dõi mức tiêu thụ điện ở cấp GPU và cấp rack, sau đó phân bổ lại phần công suất điện còn dư giữa các node. 2
3
Trong cụm gồm 5 rack và 19 node, Lambda vận hành được 19 node trong mức ngân sách điện vốn thường chỉ dành cho 16 node chạy toàn công suất. Theo kết quả được công bố, thông lượng token của cả cụm tăng 24%, từ xấp xỉ 4 triệu lên 5 triệu token mỗi giây; hiệu năng trên mỗi watt tăng 23%. 2
3
Ý nghĩa của phép thử nằm ở vận hành thực tế. Nếu đặc tính dùng điện của các tác vụ thay đổi theo thời điểm, phần công suất chưa khai thác có thể được dùng cho node khác. Nhờ vậy, nhà vận hành có thể tăng đầu ra suy luận mà chưa cần tăng công suất cấp điện cho địa điểm hoặc xây thêm cơ sở mới.
Nvidia cũng nêu các mức cải thiện tiềm năng cho những hệ thống Vera Rubin NVL72 trong tương lai. Công ty dự kiến DSX MaxLPS có thể cho phép tăng tới 40% năng lực GPU trong cùng giới hạn điện của địa điểm, đồng thời tăng tới 35% thông lượng token, tùy điều kiện triển khai. 2
3
Cần tách bạch hai nhóm số liệu này: kết quả Lambda là dữ liệu được báo cáo từ môi trường triển khai trên nền tảng Blackwell, còn các con số Vera Rubin là dự báo của Nvidia cho nền tảng tương lai. 2
3
Chủ đề lớn thứ hai là tính linh hoạt theo điều kiện lưới điện. Nvidia cho rằng không phải mọi tác vụ AI đều có mức độ khẩn cấp giống nhau: suy luận phục vụ dịch vụ đang chạy có thể là ưu tiên cao, trong khi huấn luyện, xử lý theo lô hoặc tác vụ ngoại tuyến đôi khi có thể tạm hoãn.
Tại AI factory Eos của Nvidia, nền tảng Conductor của Emerald AI đã phối hợp với Silicon Valley Power trong một chương trình phụ tải linh hoạt thương mại. Nvidia cho biết hệ thống đã phản hồi hơn 200 tín hiệu nhu cầu từ đơn vị điện lực; ở một lần trình diễn, mức tiêu thụ của cơ sở giảm từ 4 MW xuống 3 MW trong chưa tới một phút. Việc giảm tải thực hiện bằng cách hạ ưu tiên các công việc linh hoạt, trong khi suy luận ưu tiên cao vẫn tiếp tục. 2
3
Nvidia xem đây là ví dụ ban đầu cho khả năng mà DSX Flex hướng tới. Theo mô tả của hãng, DSX Flex sẽ nhận tín hiệu cắt giảm phụ tải, phản ứng nhu cầu hoặc giá điện, sau đó áp dụng thứ tự ưu tiên để các tác vụ có thể trì hoãn tạm dừng rồi chạy lại, còn dịch vụ quan trọng vẫn được duy trì. Mô hình ở Eos là bằng chứng quy mô thương mại có trước, không phải một đợt cài đặt DSX Flex. 2
3
Các công bố tại hội nghị cho thấy Nvidia đang định vị mình vượt ra ngoài vai trò nhà cung cấp GPU. Hệ sinh thái mà hãng đề xuất bao gồm điện toán Vera Rubin, mạng mở rộng NVLink, phần mềm suy luận Dynamo, mạng Ethernet và SuperNIC, các thành phần hạ tầng BlueField, tối ưu điện năng ở cấp rack và vận hành tác vụ có nhận biết trạng thái lưới điện. 2
Groq 3 LPX cũng nằm trong cách định vị này. Nvidia mô tả đây là bộ tăng tốc suy luận tương tác cho Vera Rubin, hướng tới yêu cầu độ trễ thấp và ngữ cảnh lớn của các hệ thống AI tác tử. 1
12 Tuy nhiên, các nguồn được cung cấp không đủ để xác nhận độc lập những tuyên bố cụ thể hơn về thời điểm phát hành, mức so sánh thông lượng trên mỗi megawatt hay hiệu năng với các mô hình trên 2 nghìn tỷ tham số.
Chiến lược này xuất hiện khi mảng trung tâm dữ liệu của Nvidia tiếp tục tăng trưởng nhanh. Trong quý II năm tài chính 2027, kết thúc ngày 26/7/2026, Nvidia báo cáo doanh thu 96,2 tỷ USD, tăng 106% so với cùng kỳ; riêng doanh thu Data Center đạt 89,0 tỷ USD. Công ty dự báo doanh thu quý III ở mức 108 tỷ USD, dao động 2%. 17
28
30
Khi khách hàng triển khai AI ở quy mô ngày càng lớn, câu hỏi thiết thực không còn chỉ là mua được bao nhiêu GPU. Đó còn là lấy điện ở đâu, khai thác tối đa đầu ra trong trần công suất sẵn có, và duy trì dịch vụ suy luận khi lưới điện hoặc hoạt động hạ tầng biến động.
Nvidia không nói rằng hiệu năng đỉnh của bộ tăng tốc đã hết quan trọng. Thông điệp của hãng là hiệu năng đỉnh, nếu đứng một mình, không còn phản ánh đầy đủ hiệu quả của AI factory.
Thước đo “token đã được kiểm chứng trên mỗi megawatt” gắn năng lực phần cứng với các ràng buộc ngoài thực tế: công suất điện tại địa điểm, sự kiện trên lưới, mức độ ưu tiên tác vụ và tính sẵn sàng của hệ thống. Mức tăng 24% thông lượng do Lambda báo cáo là một dữ liệu triển khai ban đầu ủng hộ luận điểm này; còn các tuyên bố rộng hơn về Vera Rubin và DSX vẫn cần được xác thực thêm trong hoạt động của khách hàng. 2
3
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Thông điệp trọng tâm của Nvidia là đánh giá AI factory bằng số token tác tử đã được kiểm chứng trên mỗi megawatt, thay vì chỉ nhìn hiệu năng tính toán đỉnh.
Thông điệp trọng tâm của Nvidia là đánh giá AI factory bằng số token tác tử đã được kiểm chứng trên mỗi megawatt, thay vì chỉ nhìn hiệu năng tính toán đỉnh. Lambda cho biết DSX MaxLPS giúp cụm HGX B200 tăng 24% thông lượng token và 23% hiệu năng trên mỗi watt trong cùng ngân sách điện.
Các con số dành cho Vera Rubin là dự báo của Nvidia; kết quả Lambda là dữ liệu kiểm chứng trong môi trường triển khai.