NVIDIA называет Nemotron 3.5 Lightning и Qwen3.8 27B подходящими моделями для локального запуска на Jetson AGX Orin и Jetson AGX Thor через vLLM. На Jetson AGX Thor сочетание NVFP4 и спекулятивного декодирования дало в тестах NVIDIA до 6,28 раза более высокую скорость декодирования относительно BF16.
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Многошаговые модели рассуждений и ИИ-агенты долго оставались слишком требовательными для встраиваемых систем: разработчикам приходилось выбирать между возможностями модели и скоростью отклика. В руководстве от 4 сентября NVIDIA утверждает, что ситуация меняется. Оптимизированные открытые модели, инференс с пониженной точностью и ускоренное декодирование позволяют запускать такие системы прямо на модулях Jetson AGX Orin и Jetson AGX Thor. 1
Главный результат, о котором сообщает NVIDIA: на Jetson AGX Thor сочетание квантования NVFP4 и спекулятивного декодирования обеспечило до 6,28 раза более высокую производительность декодирования по сравнению с BF16. Это результат для конкретных моделей и условий теста, а не универсальная гарантия скорости в токенах в секунду. Но он показывает, почему локальные агенты становятся практичнее для робототехники, транспорта и промышленного оборудования. 1
Для Jetson AGX Orin и Jetson AGX Thor NVIDIA рекомендует, в частности, модели Nemotron 3.5 Lightning и Qwen3.8-27B. Их можно обслуживать на устройстве через vLLM, а производительность повышать двумя взаимодополняющими способами: квантованием NVFP4 и спекулятивным декодированием. 1
NVFP4 использует 4-битные представления с плавающей точкой, сокращая объём вычислений и памяти, необходимых для операций модели. Для встраиваемого инференса это существенно: ограничением часто становится не только производительность вычислительных блоков, но и скорость передачи весов и активаций во время генерации. 1
Jetson Thor особенно ориентирован на такой подход: по данным NVIDIA, GPU архитектуры Blackwell в этой платформе поддерживает FP4 аппаратно через Transformer Engine. 3
При спекулятивном декодировании небольшая черновая модель предлагает несколько следующих токенов, а основная модель проверяет их сразу вместе и всё равно принимает окончательное решение. Если она подтверждает несколько предложенных токенов, генерация продвигается сразу на несколько шагов вместо одного. 1
Ускорение зависит от того, насколько часто основная модель принимает предложения черновой модели. Поэтому итоговая производительность меняется в зависимости от модели, запроса и настроек декодирования; это оптимизация под конкретную нагрузку, а не фиксированный множитель скорости.
Nemotron 3.5 Lightning — модель типа mixture-of-experts (MoE) с 30 млрд параметров, однако на каждый токен она активирует только 3 млрд. NVIDIA описывает её как модель для исполнительного уровня постоянно работающих агентов. 2
Такой подход интересен агентам, которым нужно часто отвечать и многократно проходить рабочий цикл: интерпретировать событие, вызвать разрешённый инструмент, оценить результат, затем продолжить работу или передать ситуацию оператору. В этом случае важны не только общее число параметров, но и число активных параметров на токен, а также стабильная скорость генерации.
Qwen3.8-27B — плотная модель: при генерации каждого токена задействуются все 27 млрд параметров. NVIDIA также позиционирует её как сильный вариант для Jetson. 1
Плотная архитектура может подойти системе, которая принимает решения реже, но предъявляет более высокие требования к каждому из них. Компромисс в том, что активация всей сети на токен потенциально требует больше вычислительных ресурсов, чем у разреженной MoE-модели.
Практический вывод из рекомендаций NVIDIA: модели следует сравнивать на реальном сценарии применения — с фактическими длинами запросов и ответов, используемыми инструментами, бюджетом задержки, ограничениями памяти и характером принимаемых решений. 1
Агенту с частой генерацией может больше подойти разреженная модель с быстрым выводом. Система, которая принимает меньше, но более сложных решений, может предпочесть плотную модель и согласиться на более медленную генерацию. Универсального победителя между этими архитектурами нет.
NVIDIA сообщает о максимальном росте скорости декодирования до 6,28 раза относительно BF16 при совместном использовании NVFP4 и спекулятивного декодирования на Jetson AGX Thor. При этом оптимальная схема спекулятивного декодирования оказалась разной: для Nemotron 3.5 Lightning лучше подошла DSpark, а для Qwen3.8-27B — DFlash2. 1
Этот показатель важен потому, что именно декодирование — поэтапное формирование выходных токенов — часто определяет воспринимаемую пользователем отзывчивость интерактивного агента. Однако переносить цифру на любую задачу нельзя: на реальную скорость влияют качество черновой модели, доля принятых токенов, размер пакета, длина контекста и конфигурация среды выполнения. 1
Модель, работающая непосредственно на устройстве, не требует обращения в удалённый дата-центр для каждого шага рассуждения. Для физических систем это может означать меньшую задержку, связанную с сетью, сохранение работоспособности при нестабильном соединении и возможность не передавать за пределы устройства потоки сенсорных данных и рабочие журналы. NVIDIA прямо связывает edge-рассуждения и агентный ИИ с задачами, где важны локальность данных и реакция в реальном времени. 1
Это не отменяет роль облачной инфраструктуры. Централизованные системы по-прежнему могут использоваться для обучения моделей, управления парком устройств, масштабной аналитики или задач, которые выходят за пределы доступной на устройстве памяти и вычислительной мощности. Меняется другое: связь с дата-центром не обязана оставаться на критическом пути каждого решения.
NVIDIA выделяет ассистентов в салоне автомобиля, обнаружение аномалий в реальном времени и роботов, работающих в тяжёлых либо удалённых условиях. 1
Общий признак таких сценариев — необходимость быстро понять локальный контекст и вовремя отреагировать. В частности, технология может быть полезна для:
Ключевые кандидаты — не просто устройства, способные запустить языковую модель. Это системы, в которых задержка, локальная обработка данных и устойчивость к отсутствию сети имеют прямую эксплуатационную ценность.
Jetson AGX Thor — старшая платформа NVIDIA для ресурсоёмких задач физического ИИ. Компания заявляет, что она сочетает GPU Blackwell со 128 ГБ памяти и обеспечивает до 2 070 FP4 TFLOPS в пределах энергопотребления до 130 Вт. 3
Такой профиль соответствует акценту руководства на NVFP4, высокопроизводительном декодировании и более крупных локальных моделях рассуждений. Jetson AGX Orin остаётся актуальным для уже сложившихся встраиваемых проектов, тогда как Thor рассчитан на более требовательные генеративные и мультимодальные нагрузки.
На начальном уровне NVIDIA также анонсировала Jetson Orin Nano 2 для робототехники, дронов доставки и инспекции, а также систем компьютерного зрения. Поставки модуля и комплекта для разработчиков ожидаются в первой половине 2027 года. 1
В результате линейка формирует многоуровневый подход: более компактные системы — для начальных edge-AI задач, AGX Orin — для зрелых встраиваемых развёртываний, а AGX Thor — для приложений, которым требуется больше памяти и вычислительных ресурсов для локальных генеративных рассуждений.
Руководство NVIDIA не утверждает, что теперь любая передовая модель без ограничений работает на каждом встраиваемом модуле. Более точный вывод другой: компактные модели рассуждений, развёртывание через vLLM, квантование NVFP4 и спекулятивное декодирование делают локальных ИИ-агентов на оборудовании класса Jetson практически реализуемыми. 1
Следующий шаг для разработчика — не теоретическая оценка, а измерение на собственной задаче: с целевой моделью, конкретным Jetson-устройством, настоящими запросами, инструментами, окнами контекста и требованиями к времени ответа. Результат до 6,28 раза показывает потенциал оптимизаций; применимость в продукте определяет только профильное тестирование. 1
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
NVIDIA называет Nemotron 3.5 Lightning и Qwen3.8 27B подходящими моделями для локального запуска на Jetson AGX Orin и Jetson AGX Thor через vLLM.
NVIDIA называет Nemotron 3.5 Lightning и Qwen3.8 27B подходящими моделями для локального запуска на Jetson AGX Orin и Jetson AGX Thor через vLLM. На Jetson AGX Thor сочетание NVFP4 и спекулятивного декодирования дало в тестах NVIDIA до 6,28 раза более высокую скорость декодирования относительно BF16.
Локальный инференс важен для роботов, автомобильных ассистентов и промышленного оборудования, которым нужны быстрый отклик, работа при нестабильной связи и локальная обработка данных.