NVIDIA називає Nemotron 3.5 Lightning і Qwen3.8 27B придатними моделями для локального запуску на Jetson AGX Orin та Jetson AGX Thor через vLLM. На Jetson AGX Thor поєднання NVFP4 і спекулятивного декодування дало до 6,28 раза вищу швидкість декодування порівняно з BF16 у конкретному тесті NVIDIA.
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Запуск моделей, здатних виконувати багатокрокові міркування, безпосередньо на вбудованому пристрої раніше майже завжди вимагав вибору між якістю моделі та швидкістю відповіді. У посібнику від 4 вересня NVIDIA стверджує, що цей компроміс поступово слабшає: оптимізовані відкриті моделі, низькоточне обчислення та швидше декодування дають змогу запускати агентний ШІ локально на модулях Jetson AGX Orin і Jetson AGX Thor. 1
Ключовий показник у матеріалі — до 6,28 раза вища пропускна здатність декодування, ніж у BF16, на Jetson AGX Thor за одночасного застосування квантування NVFP4 і спекулятивного декодування. Це результат для певних моделей і конфігурацій, а не універсальна обіцянка кількості токенів за секунду. Проте він показує, чому локальні ШІ-агенти стають практичнішими для робототехніки, транспортних і промислових систем. 1
NVIDIA рекомендує для Jetson AGX Orin і Jetson AGX Thor моделі Nemotron 3.5 Lightning та Qwen3.8-27B. Їх можна обслуговувати локально через vLLM, а продуктивність підвищувати двома взаємодоповнювальними методами: NVFP4 і спекулятивним декодуванням. 1
NVFP4 використовує 4-бітове представлення чисел із плаваючою комою. Це зменшує обсяг обчислень і пам’яті, потрібних для операцій моделі. Для вбудованого ШІ особливо важливим є скорочення обміну даними з пам’яттю: під час генерації тексту вузьким місцем часто стає не тільки обчислювальна потужність, а й швидкість передавання ваг моделі та активацій. 1
Jetson Thor особливо пристосований до такого підходу: за даними NVIDIA, його графічний процесор архітектури Blackwell має нативну підтримку FP4 через Transformer Engine. 3
За спекулятивного декодування менша «чернеткова» модель пропонує кілька наступних токенів, а основна модель перевіряє їх пакетом і зберігає за собою остаточне рішення. Якщо основна модель приймає кілька запропонованих токенів, генерація просувається відразу на кілька позицій, а не по одному токену за крок. 1
Виграш залежить від того, як часто основна модель приймає пропозиції чернеткової моделі. Тому результат змінюється залежно від моделі, запиту та параметрів декодування — це оптимізація під навантаження, а не гарантований множник швидкості.
Ці моделі пропонують різні компроміси для периферійного розгортання.
Nemotron 3.5 Lightning — це модель типу mixture-of-experts (MoE) із 30 млрд параметрів, але для кожного токена вона активує лише 3 млрд параметрів. NVIDIA позиціонує її для виконавчого рівня довготривалих агентів, що працюють постійно. 2
Такий підхід корисний, коли агенту потрібно часто генерувати відповіді або циклічно виконувати операційні дії: інтерпретувати подію, викликати дозволений інструмент, перевіряти результат і вирішувати, чи продовжувати роботу, чи передати випадок оператору. Тут важливі не лише загальна кількість параметрів, а й число активних параметрів на токен та стабільна швидкість генерації.
Qwen3.8-27B — щільна модель: під час створення кожного токена залучаються всі її 27 млрд параметрів. NVIDIA також називає її сильним варіантом для Jetson. 1
Щільна архітектура може бути доречною, коли система ухвалює менше рішень, але цінність кожного з них вища. Водночас активація всієї мережі на кожен токен здатна вимагати більше обчислювальних ресурсів, ніж розріджена MoE-модель.
Практична рекомендація NVIDIA — тестувати моделі на реальному застосунку: з його довжиною запитів і відповідей, інструментами, бюджетом затримки, обмеженнями пам’яті та частотою ухвалення рішень. 1
Агент із великою кількістю коротких реакцій може отримати перевагу від розрідженої моделі зі швидкою генерацією. Система, яка виконує рідші, але складніші оцінки, може прийняти нижчу швидкість заради потрібної поведінки щільної моделі. Універсально кращої архітектури для всіх edge-сценаріїв немає.
NVIDIA повідомляє про максимальне 6,28-разове підвищення пропускної здатності декодування відносно BF16 при поєднанні NVFP4 і спекулятивного декодування на Jetson AGX Thor. Найкраща конфігурація виявилася різною для різних моделей: для Nemotron 3.5 Lightning найкраще спрацював DSpark, а для Qwen3.8-27B — DFlash2. 1
Це важливо, адже саме декодування — послідовне створення вихідних токенів — часто визначає, наскільки швидкою користувач сприймає реакцію інтерактивного агента. Але цифру не слід трактувати як швидкісну характеристику для будь-якого запиту чи проєкту: на фактичну пропускну здатність впливають якість чернеткової моделі, частка прийнятих токенів, розмір пакета, довжина контексту та налаштування середовища виконання. 1
Модель на пристрої не потребує обов’язкового звернення до віддаленого дата-центру для кожного етапу міркування. Для фізичних систем це може означати меншу затримку, пов’язану з мережею, роботу за переривчастого з’єднання та можливість залишати потоки сенсорних даних і операційні журнали на пристрої. NVIDIA прямо пов’язує локальні міркування й агентний ШІ з випадками, де критичні локальність даних і реакція в реальному часі. 1
Це не скасовує роль хмари. Централізована інфраструктура й надалі потрібна для навчання моделей, керування парком пристроїв, масштабної аналітики або завдань, що перевищують доступні на пристрої ресурси пам’яті та обчислень. Зміна полягає в іншому: зв’язок із дата-центром не обов’язково має бути критичним шляхом для кожного рішення.
NVIDIA виділяє асистентів у салоні автомобіля, виявлення аномалій у реальному часі та роботів, що працюють у складних або віддалених умовах. 1
Спільна риса таких сценаріїв — потреба швидко інтерпретувати локальний контекст і реагувати достатньо оперативно, щоб реакція мала практичну користь. Потенційні приклади:
Найкращими кандидатами є не просто пристрої, здатні запустити велику мовну модель, а системи, де затримка, вимоги до локальності даних і здатність працювати офлайн мають безпосередню операційну цінність.
Jetson AGX Thor — старша платформа NVIDIA для ресурсомістких завдань фізичного ШІ. За заявою компанії, вона поєднує GPU Blackwell зі 128 ГБ пам’яті та забезпечує до 2 070 FP4 TFLOPS у межах енергоспоживання до 130 Вт. 3
Такий профіль обладнання відповідає акценту посібника на NVFP4, високошвидкісному декодуванні та більших локальних моделях міркувань. AGX Orin зберігає актуальність для вже усталених вбудованих рішень, тоді як Thor націлено на складніші генеративні та мультимодальні навантаження.
У початковому сегменті NVIDIA також анонсувала Jetson Orin Nano 2 — для робототехніки, дронів доставки й інспекції та систем комп’ютерного зору. Компанія очікує появу модуля й комплекту для розробників у першій половині 2027 року. 1
Отже, лінійка вибудовується за рівнями: компактні системи для базового edge-ШІ, AGX Orin для зрілих вбудованих розгортань і AGX Thor для завдань, яким потрібно більше пам’яті та обчислювальних ресурсів для локального генеративного міркування.
Посібник NVIDIA не стверджує, що будь-яку передову модель уже можна без проблем запустити на кожному вбудованому модулі. Висновок вужчий і практичніший: компактні моделі міркувань, розгортання через vLLM, квантування NVFP4 і спекулятивне декодування здатні зробити локальних агентів реалістичними на обладнанні класу Jetson. 1
Для розробників наступний крок має бути емпіричним: перевірити цільову модель на конкретному Jetson-пристрої з реальними запитами, інструментами, вікнами контексту та вимогами до часу відповіді. Показник 6,28× демонструє потенціал оптимізації; чи перетвориться він на придатну для продукту edge-ШІ систему, покаже лише тестування конкретного сценарію. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA називає Nemotron 3.5 Lightning і Qwen3.8 27B придатними моделями для локального запуску на Jetson AGX Orin та Jetson AGX Thor через vLLM.
NVIDIA називає Nemotron 3.5 Lightning і Qwen3.8 27B придатними моделями для локального запуску на Jetson AGX Orin та Jetson AGX Thor через vLLM. На Jetson AGX Thor поєднання NVFP4 і спекулятивного декодування дало до 6,28 раза вищу швидкість декодування порівняно з BF16 у конкретному тесті NVIDIA.
Локальний запуск важливий для роботів, автомобільних систем і промислового обладнання, яким потрібні швидка реакція, локальність даних та стійкість до нестабільного зв’язку.