NVIDIA cho biết Jetson AGX Orin và AGX Thor có thể chạy cục bộ Nemotron 3.5 Lightning và Qwen3.8 27B; trên AGX Thor, NVFP4 kết hợp speculative decoding đạt mức tăng thông lượng giải mã tối đa 6,28 lần so với BF16 tron... Nemotron 3.5 Lightning là mô hình MoE 30 tỷ tham số nhưng chỉ kích hoạt 3 tỷ tham số mỗi token,...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Việc chạy mô hình suy luận nhiều bước trên một thiết bị nhúng trước đây thường buộc phải đánh đổi: hoặc giảm năng lực mô hình, hoặc chấp nhận phản hồi chậm. Hướng dẫn dành cho nhà phát triển của NVIDIA công bố ngày 4/9 cho rằng điều này đang thay đổi. Với các mô hình mở đã tối ưu, suy luận độ chính xác thấp và kỹ thuật giải mã nhanh hơn, AI suy luận và AI tác tử có thể vận hành trực tiếp trên các mô-đun Jetson AGX Orin và Jetson AGX Thor. 1
Con số đáng chú ý nhất là thông lượng giải mã cao hơn tối đa 6,28 lần so với BF16 trên Jetson AGX Thor khi kết hợp lượng tử hóa NVFP4 với speculative decoding (giải mã suy đoán). Đây là kết quả benchmark phụ thuộc vào mô hình và khối lượng công việc, không phải cam kết cố định về số token/giây cho mọi trường hợp. Tuy vậy, nó cho thấy các tác tử AI cục bộ đang thực tế hơn đối với robot, phương tiện và thiết bị công nghiệp. 1
NVIDIA đề xuất Nemotron 3.5 Lightning và Qwen3.8-27B là hai lựa chọn phù hợp cho Jetson AGX Orin và Jetson AGX Thor. Nhà phát triển có thể phục vụ mô hình bằng vLLM trên Jetson, sau đó phối hợp hai kỹ thuật nhằm cải thiện hiệu quả suy luận. 1
NVFP4 dùng biểu diễn dấu phẩy động 4-bit để giảm lượng tính toán và bộ nhớ cần cho các phép toán của mô hình. Với suy luận nhúng, giảm việc di chuyển dữ liệu trong bộ nhớ đặc biệt quan trọng: giới hạn thực tế không chỉ nằm ở năng lực tính toán thô, mà còn ở tốc độ đưa trọng số và kích hoạt đi qua hệ thống trong lúc sinh văn bản. 1
Jetson Thor đặc biệt phù hợp với cách tiếp cận này vì GPU Blackwell của nền tảng có hỗ trợ FP4 gốc thông qua Transformer Engine, theo NVIDIA. 3
Trong speculative decoding, một mô hình nháp nhỏ hơn đề xuất trước một số token kế tiếp; mô hình chính sẽ xác minh chúng cùng lúc và vẫn là bên đưa ra quyết định cuối cùng. Nếu nhiều token đề xuất được chấp nhận, quá trình sinh có thể tiến thêm nhiều token trong một bước xác minh, thay vì tạo từng token một. 1
Lợi ích phụ thuộc vào tỷ lệ token từ mô hình nháp được chấp nhận. Vì thế, hiệu năng sẽ thay đổi theo mô hình, prompt và cấu hình giải mã; đây nên được xem là tối ưu hóa theo khối lượng công việc, không phải một hệ số tăng tốc cố định.
Nemotron 3.5 Lightning là mô hình mixture-of-experts (MoE) 30 tỷ tham số, nhưng chỉ kích hoạt 3 tỷ tham số cho mỗi token. NVIDIA định vị mô hình này cho lớp thực thi của các tác tử chạy liên tục trong thời gian dài. 2
Kiến trúc đó có thể phù hợp khi tác tử cần phản hồi thường xuyên hoặc liên tục xử lý các vòng lặp vận hành: diễn giải sự kiện, gọi công cụ đã được cho phép, kiểm tra kết quả rồi quyết định tiếp tục hay chuyển trường hợp cho con người. Khi ấy, tổng số tham số không phải chỉ số duy nhất; số tham số hoạt động trên mỗi token và tốc độ sinh đầu ra bền vững mới đáng chú ý.
Qwen3.8-27B là mô hình dense, tức toàn bộ 27 tỷ tham số tham gia xử lý mỗi token. NVIDIA xếp đây là một lựa chọn mạnh trên Jetson, song hành với Nemotron 3.5 Lightning. 1
Mô hình dense có thể hợp với ứng dụng có ít quyết định hơn nhưng yêu cầu chất lượng cao hơn cho từng quyết định. Đổi lại, việc kích hoạt toàn bộ mạng ở mỗi token có thể đòi hỏi nhiều năng lực tính toán hơn so với mô hình MoE thưa.
Thông điệp thực tế từ NVIDIA là cần benchmark theo ứng dụng thật: độ dài prompt và phản hồi, các công cụ được gọi, ngân sách độ trễ, giới hạn bộ nhớ và nhịp độ ra quyết định. 1
Một tác tử phải sinh phản hồi liên tục có thể phù hợp hơn với mô hình thưa có tốc độ xuất token cao. Trong khi đó, hệ thống đưa ra ít phán đoán hơn nhưng phức tạp hơn có thể chấp nhận tốc độ sinh chậm hơn để đổi lấy hành vi từ mô hình dense. Không có kiến trúc nào tự động tốt hơn cho mọi triển khai tại biên.
NVIDIA báo cáo mức cải thiện thông lượng giải mã tối đa 6,28 lần so với BF16 khi kết hợp NVFP4 và speculative decoding trên Jetson AGX Thor. Cấu hình speculative decoding tối ưu cũng khác nhau giữa các mô hình: DSpark đạt kết quả tốt nhất với Nemotron 3.5 Lightning, còn DFlash2 phù hợp nhất với Qwen3.8-27B. 1
Kết quả này đáng chú ý vì công đoạn giải mã — quá trình tạo token đầu ra từng bước — thường quyết định cảm nhận về độ phản hồi của một tác tử tương tác. Tuy nhiên, không nên hiểu đây là tuyên bố tốc độ áp dụng chung cho mọi prompt, mô hình hay môi trường triển khai. Chất lượng mô hình nháp, tỷ lệ chấp nhận token, kích thước batch, độ dài ngữ cảnh và cấu hình thời gian chạy đều có thể tác động đến thông lượng thực tế. 1
Khi mô hình chạy ngay trên thiết bị, mỗi yêu cầu suy luận không còn bắt buộc phải đi qua một trung tâm dữ liệu từ xa. Với các hệ thống vật lý, điều này có thể giúp giảm độ trễ do mạng, duy trì vận hành khi kết nối chập chờn và giữ luồng dữ liệu cảm biến hoặc nhật ký vận hành trên thiết bị. NVIDIA nhấn mạnh AI suy luận và tác tử tại biên đặc biệt có giá trị khi tính cục bộ của dữ liệu và phản hồi thời gian thực là yêu cầu quan trọng. 1
Điều đó không đồng nghĩa hạ tầng đám mây trở nên không cần thiết. Doanh nghiệp vẫn có thể dùng hệ thống tập trung cho huấn luyện mô hình, quản lý đội thiết bị, phân tích quy mô lớn hoặc các tác vụ vượt quá bộ nhớ và năng lực tính toán sẵn có trên thiết bị. Điểm chuyển dịch quan trọng là kết nối tới trung tâm dữ liệu không nhất thiết phải nằm trên đường đi trọng yếu của mọi quyết định.
NVIDIA nêu các ví dụ gồm trợ lý trong khoang xe, phát hiện bất thường theo thời gian thực và robot hoạt động ở môi trường khắc nghiệt hoặc vùng xa. 1
Điểm chung của các trường hợp này là hệ thống phải hiểu bối cảnh tại chỗ và phản hồi đủ nhanh để có ích. Những hướng ứng dụng tiềm năng gồm:
Ứng viên phù hợp nhất không đơn thuần là thiết bị có thể chạy một LLM. Đó là các hệ thống nơi thời gian đáp ứng, yêu cầu riêng tư hoặc dữ liệu tại chỗ, cùng khả năng chống chịu khi mất kết nối, tạo ra giá trị vận hành trực tiếp.
Jetson AGX Thor là nền tảng cao cấp của NVIDIA cho các khối lượng công việc AI vật lý đòi hỏi cao. NVIDIA cho biết sản phẩm kết hợp GPU Blackwell với 128 GB bộ nhớ và đạt tới 2.070 TFLOPS FP4 trong mức công suất 130 W. 3
Hồ sơ phần cứng này phù hợp với trọng tâm của hướng dẫn: NVFP4, giải mã thông lượng cao và các mô hình suy luận cục bộ lớn hơn. AGX Orin vẫn có vai trò cho các triển khai nhúng đã trưởng thành, còn Thor nhắm đến những tác vụ sinh nội dung và đa phương thức nặng hơn.
Ở phân khúc phổ thông, NVIDIA đã công bố Jetson Orin Nano 2 cho robot, drone giao hàng và kiểm tra, cùng các hệ thống AI thị giác. NVIDIA cho biết mô-đun và bộ kit phát triển dự kiến có mặt trong nửa đầu năm 2027. 1
Nhìn tổng thể, danh mục này thể hiện cách tiếp cận phân tầng: hệ thống nhỏ hơn cho AI biên cấp nhập môn, AGX Orin cho các triển khai nhúng đã ổn định, và AGX Thor cho ứng dụng cần nhiều bộ nhớ cũng như năng lực tính toán hơn để suy luận sinh nội dung ngay trên thiết bị.
Hướng dẫn của NVIDIA không nói rằng mọi mô hình tiên phong đều đã có thể chạy thoải mái trên mọi mô-đun nhúng. Kết luận hữu ích hơn, và hẹp hơn, là: các mô hình suy luận gọn hơn, triển khai bằng vLLM, lượng tử hóa NVFP4 và speculative decoding có thể biến tác tử AI cục bộ có năng lực thành lựa chọn khả thi trên phần cứng dòng Jetson. 1
Bước tiếp theo cho nhà phát triển là đo đạc, không phải chỉ suy đoán: hãy kiểm thử mô hình mục tiêu trên đúng thiết bị Jetson, với prompt, công cụ, cửa sổ ngữ cảnh và yêu cầu thời gian phản hồi của sản phẩm thật. Mức tăng 6,28 lần cho thấy tiềm năng của tối ưu hóa; benchmark theo ứng dụng mới quyết định liệu tiềm năng đó có trở thành một hệ thống AI biên dùng được hay không. 1
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
NVIDIA cho biết Jetson AGX Orin và AGX Thor có thể chạy cục bộ Nemotron 3.5 Lightning và Qwen3.8 27B; trên AGX Thor, NVFP4 kết hợp speculative decoding đạt mức tăng thông lượng giải mã tối đa 6,28 lần so với BF16 tron...
NVIDIA cho biết Jetson AGX Orin và AGX Thor có thể chạy cục bộ Nemotron 3.5 Lightning và Qwen3.8 27B; trên AGX Thor, NVFP4 kết hợp speculative decoding đạt mức tăng thông lượng giải mã tối đa 6,28 lần so với BF16 tron... Nemotron 3.5 Lightning là mô hình MoE 30 tỷ tham số nhưng chỉ kích hoạt 3 tỷ tham số mỗi token, trong khi Qwen3.8 27B là mô hình dense huy động toàn bộ 27 tỷ tham số cho mỗi token.
Suy luận tại chỗ giúp robot, xe và hệ thống công nghiệp giảm phụ thuộc vào kết nối trung tâm dữ liệu, song nhà phát triển vẫn cần benchmark bằng prompt, công cụ, ngân sách độ trễ và giới hạn bộ nhớ thực tế.