Ra mắt ngày 11/8/2026, Nemotron 3.5 Lightning là mô hình Mixture of Experts mở 30B với khoảng 3B tham số được kích hoạt mỗi bước, tập trung vào các tác vụ thực thi lặp lại và khối lượng lớn thay vì thay thế mô hình lý... Kiến trúc lai, các phiên bản BF16 và NVFP4 cùng cửa sổ ngữ cảnh được quảng bá lên tới 1 triệu to...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Nvidia’s Nemotron 3.5 Lightning, released on August 11 as a 30-billion-parameter open model for the execution layer of autonomous AI. Article summary: NVIDIA Nemotron 3.5 Lightning is best understood as a high-volume “worker” model for autonomous-agent systems: an open 30B-parameter MoE model that activates roughly 3B parameters per inference step, rather than a model . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA Nemotron 3.5 Lightning là một mô hình thực thi chuyên dụng cho các AI agent tự vận hành. Được phát hành ngày 11/8/2026, mô hình có tổng cộng 30 tỷ tham số nhưng chỉ sử dụng khoảng 3 tỷ tham số ở mỗi bước suy luận, phù hợp với các tác vụ lặp lại, cần xử lý liên tục và có sản lượng lớn hơn là trở thành lựa chọn thay thế cho những hệ thống lý luận tổng quát mạnh nhất.
Điểm này là chìa khóa để hiểu Lightning. Trong một agent hoạt động dài hạn, phần khó nhất có thể là diễn giải mục tiêu và lập kế hoạch. Nhưng sau đó, quy trình thường gồm hàng loạt thao tác nhỏ: gọi công cụ, trích xuất trường dữ liệu, kiểm tra chính sách, biến đổi thông tin và định dạng câu trả lời. Lightning được thiết kế để đảm nhiệm nhanh và tiết kiệm hơn chính lớp công việc này.
Lightning là mô hình Mixture-of-Experts (MoE) mở 30B do NVIDIA phát triển cho các tác vụ chuyên biệt trong những agent luôn hoạt động. NVIDIA mô tả dòng Nemotron là các mô hình mở về trọng số, dữ liệu huấn luyện và công thức huấn luyện, qua đó cho phép nhà phát triển đánh giá, tùy biến trước khi đưa vào sản phẩm.
Mô hình được phát hành ở hai định dạng BF16 và NVFP4. Tài liệu của NVIDIA cũng mô tả Lightning là kiến trúc lai, kết hợp xử lý kiểu state-space hoặc Mamba, cơ chế attention và các expert được định tuyến. Mục tiêu là cung cấp năng lực của một mô hình lớn hơn nhưng không phải kích hoạt toàn bộ mạng cho mỗi token.
Hai con số “30B” và “3B active” nói về hai khía cạnh khác nhau:
Cách thực thi thưa này giúp Lightning thuộc nhóm mô hình có tổng dung lượng lớn nhưng hướng đến chi phí tính toán trên mỗi token tương tự một mạng nhỏ hơn. Tuy nhiên, nó không loại bỏ nhu cầu lưu trữ hay quản lý toàn bộ mô hình; lợi ích chính nằm ở việc giảm lượng tính toán được sử dụng trong từng bước sinh.
Một AI agent tự vận hành thường tạo ra rất nhiều lượt gọi mô hình. Một nhiệm vụ cấp cao có thể bao gồm nhiều lần chọn công cụ, trích xuất dữ liệu có cấu trúc, xác minh và định dạng kết quả sau khi kế hoạch ban đầu đã được lập.
Nếu dùng một mô hình quy mô lớn cho mọi lượt gọi, độ trễ và chi phí vận hành có thể tăng đáng kể. Lightning được định vị để xử lý phần công việc dễ dự đoán và xuất hiện thường xuyên, trong khi mô hình có năng lực cao hơn vẫn được giữ lại cho các quyết định mơ hồ hoặc yêu cầu suy luận phức tạp.
Một kiến trúc hai tầng điển hình có thể vận hành như sau:
NVIDIA định vị Nemotron 3 Ultra — mô hình MoE có 550B tham số tổng và 55B tham số hoạt động — cho lý luận cấp cao và điều phối. Sự tương phản này cho thấy rõ vai trò khác nhau giữa Ultra và Lightning.
Giá trị của Lightning phụ thuộc một phần vào khả năng định tuyến. Agent cần biết bước nào nên giao cho mô hình nào, thay vì gửi mọi yêu cầu đến cùng một endpoint.
NeMo Switchyard của NVIDIA cung cấp SDK định tuyến không phụ thuộc nhà cung cấp. Công cụ này cho phép biểu diễn yêu cầu, xác định các mô hình mục tiêu và quản lý cuộc gọi đến nhà cung cấp hoặc model ID đã chọn.
Về thực tế, Switchyard hỗ trợ xây dựng hệ thống phân cấp mô hình: Lightning xử lý những lượt gọi thường lệ, còn mô hình lớn hơn nhận các trường hợp cần năng lực cao hơn.
Đây là điểm quan trọng về kiến trúc: Lightning không có nhiều ý nghĩa nhất khi được dùng như một chatbot độc lập. Vị trí phù hợp hơn của nó là một mắt xích trong hệ thống agent đa mô hình có cơ chế định tuyến.
Lightning được quảng bá với khả năng xử lý ngữ cảnh lên tới 1 triệu token. Đây là đặc điểm đáng chú ý với các agent duy trì hội thoại dài, xử lý tài liệu lớn hoặc liên tục làm việc với trạng thái tác vụ nhiều dữ liệu. Dung lượng ngữ cảnh có thể sử dụng thực tế và hiệu năng cuối cùng vẫn phụ thuộc vào phần mềm phục vụ cùng cấu hình triển khai.
Checkpoint NVFP4 hướng đến triển khai suy luận và sử dụng các kernel chuyên dụng của NVIDIA trên những thế hệ GPU được hỗ trợ. NVIDIA liệt kê nhiều môi trường triển khai, từ hạ tầng tại chỗ, máy trạm và trung tâm dữ liệu đến đám mây; mô hình cũng có trên Hugging Face và các dịch vụ lưu trữ.
AWS cho biết Nemotron 3.5 Lightning đã có mặt trên SageMaker JumpStart, cho phép triển khai thông qua bảng điều khiển SageMaker hoặc Python SDK. Tài liệu NIM của NVIDIA cung cấp một hướng triển khai đóng gói bằng container, đi kèm các yêu cầu cụ thể về hệ điều hành, CUDA, driver và Docker.
Dù vậy, khả năng chạy trên một GPU đơn lẻ cần được xem xét thận trọng. Checkpoint lượng tử hóa có thể giúp việc phục vụ mô hình thực tế hơn, nhưng tính khả thi phụ thuộc vào GPU, dung lượng bộ nhớ, độ dài ngữ cảnh, phương thức lượng tử hóa, kích thước batch và phần mềm phục vụ. Các tuyên bố về mức giảm dung lượng lưu trữ hoặc phạm vi hỗ trợ rộng cho GPU GeForce RTX nên được đối chiếu với model card và công thức triển khai hiện hành, thay vì áp dụng cho mọi laptop hay máy tính để bàn.
NVIDIA và AWS quảng bá mức throughput cao hơn tới 4 lần cùng thời gian hoàn thành tác vụ nhanh hơn tới 30% trong các workload agent mục tiêu. Đây không phải thước đo phổ quát về trí tuệ của mô hình, cũng không phải cam kết về hiệu năng trong mọi môi trường sản xuất.
Kết quả thực tế có thể thay đổi tùy theo:
Vì vậy, Lightning nên được đánh giá bằng các chỉ số gắn với agent cụ thể, chẳng hạn độ chính xác khi trích xuất, độ tin cậy khi gọi công cụ, khả năng tuân thủ đầu ra có cấu trúc và thời gian hoàn thành từ đầu đến cuối — không chỉ dựa vào số token mỗi giây.
Giá dịch vụ lưu trữ có thể khiến Lightning trở nên đáng chú ý với các hệ thống suy luận khối lượng lớn. DeepInfra niêm yết mức 0,05 USD cho mỗi 1 triệu token đầu vào và 0,20 USD cho mỗi 1 triệu token đầu ra, theo hình thức tính phí dựa trên mức sử dụng và không yêu cầu đội ngũ tự quản lý hạ tầng GPU.
Tuy nhiên, đây không phải mức giá cố định gắn vĩnh viễn với mô hình. Các nhà cung cấp khác niêm yết mức khác nhau; nhà cung cấp, độ chính xác, cơ chế cache và tuyến phục vụ đều có thể ảnh hưởng đến chi phí hiệu dụng.
Khi so sánh Lightning với mô hình lớn hơn, doanh nghiệp nên tính tổng chi phí của cả quy trình, bao gồm các lần thử lại, lượt gọi công cụ, chi phí định tuyến và những yêu cầu cuối cùng vẫn phải chuyển sang mô hình mạnh hơn.
Nemotron 3.5 Lightning nên được xem là một mô hình worker nhanh, có thể tùy biến cho các hệ thống agent. Thiết kế này phù hợp khi ứng dụng tạo ra nhiều lượt gọi tương tự nhau, đồng thời nhiệm vụ có thể được chuyên biệt hóa, giới hạn bằng quy tắc hoặc hậu huấn luyện.
Mô hình không được định vị như một lựa chọn thay thế toàn diện cho mô hình điều phối lớn. Lập kế hoạch phức tạp, phán đoán trong điều kiện thiếu chắc chắn và các tác vụ có chi phí sai sót cao vẫn có thể cần Nemotron 3 Ultra hoặc một hệ thống frontier khác.
Kết luận thực tế khá rõ ràng: Lightning phát huy vai trò tốt nhất ở tầng thực thi độ trễ thấp trong một hệ thống agent đa mô hình có định tuyến. Tổng năng lực 30B, khoảng 3B tham số hoạt động, tài liệu mô hình mở, tùy chọn suy luận NVFP4 và nhiều hướng triển khai đều nhằm làm cho các công việc thường lệ của agent rẻ hơn và nhanh hơn. Những mức cải thiện được quảng bá là đáng chú ý, nhưng cần được kiểm chứng trên đúng workflow trước khi xem như kết quả sản xuất.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 11/8/2026, Nemotron 3.5 Lightning là mô hình Mixture of Experts mở 30B với khoảng 3B tham số được kích hoạt mỗi bước, tập trung vào các tác vụ thực thi lặp lại và khối lượng lớn thay vì thay thế mô hình lý...
Ra mắt ngày 11/8/2026, Nemotron 3.5 Lightning là mô hình Mixture of Experts mở 30B với khoảng 3B tham số được kích hoạt mỗi bước, tập trung vào các tác vụ thực thi lặp lại và khối lượng lớn thay vì thay thế mô hình lý... Kiến trúc lai, các phiên bản BF16 và NVFP4 cùng cửa sổ ngữ cảnh được quảng bá lên tới 1 triệu token hướng đến những agent hoạt động liên tục, nhưng các tuyên bố về tốc độ vẫn cần được kiểm chứng trên từng phần cứng và...
Mô hình phát huy hiệu quả nhất trong hệ thống hai tầng: mô hình lớn đảm nhiệm lập kế hoạch và quyết định khó, còn Lightning xử lý gọi công cụ, trích xuất dữ liệu, kiểm tra chính sách và định dạng kết quả.