Bắt đầu từ quý 3 năm 2026, Nvidia đã mở rộng đánh giá cấu hình HBM của Rubin Ultra ra ngoài kế hoạch ban đầu là một 12-Hi HBM4e cơ bản . Theo TrendForce, công ty hiện đang thử nghiệm song song bốn phương án thay thế :
Chưa có thông số kỹ thuật cuối cùng nào được thiết lập . Sự thay đổi này là phản ứng trực tiếp trước tình trạng thiếu hụt DRAM trên toàn ngành dự kiến vào năm 2027, có thể hạn chế công suất wafer dành cho sản xuất HBM, cùng với sự không chắc chắn về tiến độ chứng nhận HBM4e của ba nhà sản xuất bộ nhớ lớn .
Trên nền tảng Vera Rubin, thay đổi được báo cáo là rõ ràng hơn. Nvidia được cho là đã quyết định giảm một nửa dung lượng bộ nhớ SOCAMM trong hệ thống rack-scale Vera Rubin NVL72, từ 192 GB xuống còn 96 GB mỗi module . Theo phân tích được trích dẫn bởi TrendForce và GF Securities, tổng dung lượng bộ nhớ Vera CPU trên mỗi rack sẽ giảm từ khoảng 55 TB xuống còn 28 TB, trong khi dung lượng HBM4 của GPU vẫn không đổi ở mức 20,7 TB mỗi rack . Động thái này nhằm giảm chi phí và giảm bớt các hạn chế về nguồn cung, khi chi phí bộ nhớ đã tăng lên ước tính khoảng 29% tổng chi phí nguyên vật liệu (BOM) của hệ thống cho nền tảng Vera Rubin .
Một số nguồn tin lưu ý rằng những gì trông giống như một sự cắt giảm bộ nhớ thực ra có thể là Nvidia đang thử nghiệm nhiều SKU dành riêng cho khách hàng — các cấp bộ nhớ khác nhau cho các khối lượng công việc khác nhau — thay vì cắt giảm một thông số kỹ thuật hàng đầu duy nhất . Cách giải thích này phù hợp với quan điểm chính thức của Nvidia.
Nvidia đã công khai phủ nhận việc Vera hay Rubin bị cắt giảm do thiếu hụt HBM. Trong một bài đăng trên blog vào ngày 7 tháng 8 năm 2026, Nvidia đã bác bỏ suy đoán, tuyên bố rằng các cấu hình đang được đề cập là các SKU khác nhau và được tinh chỉnh theo yêu cầu của khách hàng, chứ không phải là sự hạ cấp do các ràng buộc về nguồn cung . Công ty cũng cho biết họ liên tục điều chỉnh khả năng tính toán, kết nối mạng và bộ nhớ để mang lại hiệu suất và hiệu quả tốt nhất cho khách hàng .
CEO Jensen Huang đã thẳng thắn hơn. Vào tháng 6 năm 2026, ông xác nhận rằng cả ba nhà sản xuất bộ nhớ lớn — Samsung, SK Hynix và Micron — đều đã được chứng nhận cung cấp HBM4, với Vera Rubin đang trong giai đoạn sản xuất hàng loạt và Rubin, Rubin Ultra cùng máy chủ Kyber đang đi đúng hướng . Vào tháng 7 năm 2026, Huang bác bỏ các báo cáo về sự chậm trễ, tuyên bố rằng việc sản xuất Vera Rubin đang tiến triển với khối lượng "khổng lồ" .
Sự căng thẳng cốt lõi rất rõ ràng: TrendForce và các nhà phân tích khác giải thích việc mở rộng đánh giá HBM như một kế hoạch dự phòng do nguồn cung thúc đẩy; Nvidia coi đó là kế hoạch biến thể sản phẩm thông thường cho các khối lượng công việc khác nhau của khách hàng.
Bộ nhớ băng thông cao 4 (HBM4) đã được bán hết cho tất cả các đơn hàng trong năm 2026, và tình trạng thiếu hụt DRAM dự kiến sẽ tiếp tục đến năm 2027 . Điều này tạo ra một rào cản về giá cả và tính khả dụng về mặt cấu trúc cho mọi nền tảng Nvidia thế hệ tiếp theo, từ Vera Rubin đến Rubin Ultra và hơn thế nữa.
Chi phí bộ nhớ đã trở thành một phần lớn hơn đáng kể trong tổng chi phí hệ thống. Ở mức khoảng 29% tổng chi phí BOM của hệ thống cho các hệ thống Vera Rubin NVL72, bộ nhớ (HBM + SOCAMM) không còn là một thành phần hỗ trợ — nó là một yếu tố thúc đẩy chi phí chính, buộc phải có những sự đánh đổi trong thiết kế .
Để đảm bảo đủ nguồn cung, Nvidia đã tiến tới khóa công suất sản xuất ở quy mô chưa từng có. Nvidia và SK Group đã công bố một sáng kiến chiến lược trị giá hơn 500 tỷ USD bao gồm quan hệ đối tác cung cấp HBM dài hạn với SK Hynix cho bộ nhớ HBM4 bao phủ thế hệ Vera Rubin . Vài ngày sau, Samsung Electronics và Broadcom đã ký kết một hợp tác trị giá 200 tỷ USD riêng biệt . Các thỏa thuận này, với tổng giá trị cam kết cung ứng khoảng 700 tỷ USD, báo hiệu rằng việc đảm bảo đủ bộ nhớ với chi phí chấp nhận được hiện là ưu tiên chiến lược trị giá hàng trăm tỷ đô la cho toàn bộ hệ sinh thái chip AI.
Thay vì đặt cược tất cả vào một cấu hình HBM4e hàng đầu duy nhất, Nvidia dường như đang chuẩn bị một danh mục SKU rộng hơn — thay đổi chiều cao ngăn xếp HBM và kích thước bộ nhớ — để phục vụ các mức giá và kịch bản sẵn có khác nhau . Điều này cho phép công ty tiếp tục vận chuyển với số lượng lớn ngay cả khi các ngăn xếp HBM4e cao cấp nhất khan hiếm. Nếu các bộ phận 12-Hi HBM4e chậm được chứng nhận, Nvidia vẫn có thể vận chuyển Rubin Ultra với các bộ phận 8-Hi HBM4e hoặc HBM4, giữ cho khách hàng được cung cấp ngay cả khi hiệu suất mỗi chip thấp hơn một chút.
Các báo cáo chỉ ra áp lực thực sự về nguồn cung và chi phí đang thúc đẩy Nvidia đánh giá các biến thể HBM có dung lượng thấp hơn và đã cắt giảm SOCAMM trong hệ thống Vera Rubin. Nvidia chính thức phủ nhận mọi sự hạ cấp bắt buộc, gọi các biến thể này là sự tinh chỉnh dành riêng cho khách hàng chứ không phải phản ứng trước tình trạng thiếu hụt. Tuy nhiên, các thỏa thuận cung cấp kỷ lục và tỷ trọng chi phí bộ nhớ ngày càng tăng trong hệ thống cho thấy rõ ràng các ràng buộc về HBM là một yếu tố chính định hình dòng sản phẩm kỷ nguyên Rubin. Thông số kỹ thuật bộ nhớ cuối cùng của Rubin Ultra vẫn chưa được công bố, nhưng hướng đi là không thể nhầm lẫn: thế hệ phần cứng AI tiếp theo sẽ không chỉ được xác định bởi hiệu suất GPU, mà còn bởi sự sẵn có và chi phí của bộ nhớ cung cấp năng lượng cho nó.