NVIDIA cite Nemotron 3.5 Lightning et Qwen3.8 27B parmi les modèles pouvant être servis localement avec vLLM sur Jetson AGX Orin et Jetson AGX Thor. Sur Jetson AGX Thor, l’association de NVFP4 et du décodage spéculatif a atteint jusqu’à 6,28× le débit de décodage du BF16 dans le benchmark de NVIDIA.
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Faire tourner un modèle capable de raisonnement en plusieurs étapes sur un appareil embarqué imposait jusqu’ici un compromis net entre capacité et réactivité. Dans un guide publié le 4 septembre, NVIDIA soutient que ce compromis s’atténue : des modèles ouverts optimisés, l’inférence à faible précision et des méthodes de génération plus rapides permettent d’exécuter des fonctions de raisonnement et d’IA agentique directement sur les modules Jetson AGX Orin et Jetson AGX Thor. 1
Le chiffre le plus marquant est un gain maximal de 6,28× du débit de décodage par rapport au BF16 sur Jetson AGX Thor, en combinant la quantification NVFP4 et le décodage spéculatif. Il s’agit d’un résultat de benchmark propre à un modèle et à une charge de travail ; ce n’est pas une promesse universelle de nombre de jetons par seconde. Il illustre néanmoins l’intérêt grandissant des agents locaux pour les robots, les véhicules et les équipements industriels. 1
NVIDIA recommande notamment Nemotron 3.5 Lightning et Qwen3.8-27B pour Jetson AGX Orin et Jetson AGX Thor. Ces modèles peuvent être servis localement avec vLLM, un moteur d’inférence pour modèles de langage. Deux techniques complémentaires visent ensuite à améliorer l’efficacité de l’inférence. 1
NVFP4 emploie une représentation flottante sur 4 bits afin de réduire les calculs et la mémoire nécessaires aux opérations du modèle. Pour un appareil embarqué, déplacer assez rapidement les poids et les activations en mémoire peut devenir aussi limitant que la puissance de calcul elle-même. 1
Jetson Thor est particulièrement adapté à cette approche : selon NVIDIA, son GPU Blackwell intègre une prise en charge native du FP4 via le Transformer Engine. 3
Le décodage spéculatif confie à un petit modèle « brouillon » la proposition de plusieurs jetons successifs. Le modèle principal les vérifie ensuite ensemble et conserve la décision finale. Si plusieurs propositions sont acceptées, la génération progresse de plusieurs jetons en une seule étape de vérification, au lieu d’avancer jeton par jeton. 1
Le gain dépend donc du taux d’acceptation des propositions, qui varie selon le modèle, l’invite, la longueur de contexte et le réglage du décodage. C’est une optimisation de charge de travail, non un multiplicateur fixe de performances.
Nemotron 3.5 Lightning est un modèle à mélange d’experts (MoE) de 30 milliards de paramètres, mais seulement 3 milliards de paramètres sont activés pour chaque jeton. NVIDIA le présente comme un modèle destiné à la couche d’exécution d’agents continus, actifs sur de longues périodes. 2
Cette architecture peut convenir à un agent qui enchaîne fréquemment des cycles opérationnels : interpréter un événement, appeler un outil autorisé, examiner le résultat, puis poursuivre ou signaler une exception. Pour ce type d’usage, le nombre total de paramètres ne suffit pas à caractériser le modèle : les paramètres actifs par jeton et la vitesse de génération soutenue comptent tout autant.
Qwen3.8-27B est un modèle dense : ses 27 milliards de paramètres participent à chaque jeton généré. NVIDIA le place lui aussi parmi les options solides pour Jetson. 1
Un modèle dense peut être pertinent lorsqu’un système prend moins de décisions, mais accorde davantage de valeur à chacune d’elles. En contrepartie, mobiliser tout le réseau à chaque jeton peut demander plus de calcul qu’un modèle MoE parcimonieux.
La recommandation pratique de NVIDIA est de tester les modèles dans les conditions de l’application réelle : longueur des invites et des réponses, appels d’outils, budget de latence, mémoire disponible et fréquence des décisions. 1
Un agent qui produit beaucoup de réponses pourra privilégier un modèle parcimonieux rapide en génération. Une application qui rend moins de décisions, mais plus complexes, pourra accepter une génération plus lente. Aucune des deux architectures n’est intrinsèquement meilleure dans tous les déploiements embarqués.
NVIDIA rapporte une amélioration maximale de 6,28× du débit de décodage face au BF16 après combinaison de NVFP4 et du décodage spéculatif sur Jetson AGX Thor. La configuration de décodage spéculatif la plus efficace différait selon le modèle : DSpark pour Nemotron 3.5 Lightning, DFlash2 pour Qwen3.8-27B. 1
Ce résultat est important car le décodage — la production séquentielle des jetons de sortie — détermine souvent la sensation de réactivité d’un agent interactif. Mais il ne doit pas être lu comme un gain garanti pour toute invite ou toute application. La qualité du modèle brouillon, le taux d’acceptation, la taille des lots, la longueur de contexte et la configuration du moteur d’exécution influencent tous le débit réel. 1
Un modèle exécuté sur l’appareil évite que chaque demande de raisonnement dépende d’un aller-retour vers un centre de données distant. Pour les systèmes physiques, cela peut réduire le délai lié au réseau, maintenir le fonctionnement lorsque la connectivité est intermittente et conserver sur l’appareil les flux de capteurs ainsi que les journaux opérationnels. NVIDIA souligne précisément l’intérêt du raisonnement à la périphérie lorsque la localisation des données et la réponse en temps réel sont essentielles. 1
Le cloud ne disparaît pas pour autant : entraînement des modèles, gestion d’une flotte d’appareils, analyses à grande échelle ou tâches dépassant la mémoire et la puissance du module resteront souvent centralisés. Le changement est que la connexion à un centre de données n’a plus nécessairement à se trouver sur le chemin critique de chaque décision.
NVIDIA cite les assistants embarqués dans l’habitacle, la détection d’anomalies en temps réel et les robots évoluant dans des environnements difficiles ou isolés. 1
Ces cas ont un point commun : le système doit interpréter un contexte local et répondre assez vite pour être utile. Les applications candidates comprennent notamment :
Les cas les plus convaincants ne sont donc pas simplement ceux où il est possible d’exécuter un grand modèle de langage. Ce sont ceux où le délai de réponse, la localisation des données et la continuité hors ligne ont une valeur opérationnelle directe.
Jetson AGX Thor constitue le niveau haut de gamme de NVIDIA pour les charges de travail exigeantes d’IA physique. NVIDIA indique que la plateforme associe un GPU Blackwell à 128 Go de mémoire et peut fournir jusqu’à 2 070 TFLOPS FP4 dans une enveloppe de 130 W. 3
Ce profil matériel correspond à l’accent mis sur NVFP4, le décodage à haut débit et les grands modèles de raisonnement locaux. AGX Orin conserve son rôle pour les déploiements embarqués déjà établis, tandis que Thor cible les charges génératives et multimodales plus ambitieuses.
À l’entrée de gamme, NVIDIA a aussi annoncé le Jetson Orin Nano 2, destiné à la robotique, aux drones de livraison et d’inspection, ainsi qu’aux systèmes de vision par IA. La disponibilité du module et du kit de développement est attendue au premier semestre 2027. 1
La stratégie dessinée est donc graduée : des systèmes plus compacts pour l’IA en périphérie d’entrée de gamme, AGX Orin pour les déploiements embarqués matures, et AGX Thor pour les applications qui exigent davantage de mémoire et de calcul afin de faire tourner localement du raisonnement génératif.
Le guide de NVIDIA ne prétend pas que tous les modèles de pointe peuvent désormais tourner confortablement sur n’importe quel module embarqué. Son message est plus ciblé : des modèles de raisonnement compacts, un déploiement avec vLLM, la quantification NVFP4 et le décodage spéculatif peuvent rendre des agents locaux performants réalisables sur du matériel Jetson. 1
Pour les développeurs, l’étape suivante est avant tout expérimentale : mesurer le modèle visé sur le Jetson choisi, avec les vraies invites, les outils, les fenêtres de contexte et les exigences de temps de réponse du produit. Le gain maximal de 6,28× montre le potentiel de l’optimisation ; seul le benchmark de l’application dira si ce potentiel se traduit en système d’IA embarquée utilisable. 1
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
NVIDIA cite Nemotron 3.5 Lightning et Qwen3.8 27B parmi les modèles pouvant être servis localement avec vLLM sur Jetson AGX Orin et Jetson AGX Thor.
NVIDIA cite Nemotron 3.5 Lightning et Qwen3.8 27B parmi les modèles pouvant être servis localement avec vLLM sur Jetson AGX Orin et Jetson AGX Thor. Sur Jetson AGX Thor, l’association de NVFP4 et du décodage spéculatif a atteint jusqu’à 6,28× le débit de décodage du BF16 dans le benchmark de NVIDIA.
L’inférence embarquée peut réduire la dépendance au réseau pour la robotique, les véhicules et l’industrie, mais le choix du modèle doit être validé sur la charge réelle.