NVIDIA noemt Nemotron 3.5 Lightning en Qwen3.8 27B geschikte modellen voor lokale inzet op Jetson AGX Orin en AGX Thor. Op Jetson AGX Thor leverde NVFP4 samen met speculative decoding in NVIDIA’s benchmark tot 6,28× meer decode doorvoer op dan BF16.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Redenerende AI die meerdere stappen uitvoert, moest op embedded hardware lange tijd kiezen: óf een kleiner model, óf een trage reactie. NVIDIA stelt in een ontwikkelaarsgids van 4 september dat die afweging minder scherp wordt. Geoptimaliseerde open modellen, inferentie met lagere precisie en snellere tokenproductie maken lokale AI-agents mogelijk op de modules Jetson AGX Orin en Jetson AGX Thor. 1
De opvallendste uitkomst: NVIDIA rapporteert op Jetson AGX Thor een decode-doorvoer die tot 6,28× hoger ligt dan BF16 wanneer NVFP4-kwantisering en speculative decoding worden gecombineerd. Dat is een resultaat voor een specifieke combinatie van model en werklast, geen algemene belofte voor iedere toepassing. Wel laat het zien waarom lokale agents realistischer worden voor robots, voertuigen en industriële apparatuur. 1
NVIDIA noemt Nemotron 3.5 Lightning en Qwen3.8-27B als sterke opties voor Jetson AGX Orin en AGX Thor. Ontwikkelaars kunnen de modellen lokaal aanbieden via vLLM en vervolgens twee elkaar aanvullende technieken toepassen. 1
NVFP4 gebruikt 4-bits floating-pointrepresentaties. Daardoor dalen de benodigde reken- en geheugenresources voor modelbewerkingen. Vooral op embedded systemen is dat belangrijk: niet alleen de rekencapaciteit telt, maar ook hoe snel gewichten en activaties tijdens het genereren door het geheugen kunnen worden verplaatst. 1
Thor sluit hier goed op aan. Volgens NVIDIA biedt de Blackwell-GPU in dit platform native FP4-ondersteuning via de Transformer Engine. 3
Bij speculative decoding stelt een kleiner draft-model alvast meerdere volgende tokens voor. Het hoofdmodel controleert die vervolgens gezamenlijk en houdt de eindbeslissing. Als het hoofdmodel meerdere voorstellen accepteert, kan de generatie in één controlestap meerdere tokens vooruitgaan, in plaats van steeds één token tegelijk. 1
De winst hangt af van hoeveel voorgestelde tokens worden geaccepteerd. Model, prompt en decoderingsconfiguratie maken dus verschil; dit is een optimalisatie voor een werklast, geen vaste versneller voor elk gebruiksscenario.
De twee modellen vertegenwoordigen verschillende keuzes voor inzet aan de edge.
Nemotron 3.5 Lightning is een mixture-of-experts-model (MoE) met 30 miljard parameters, maar activeert per token slechts 3 miljard parameters. NVIDIA positioneert het voor de uitvoeringslaag van langdurig draaiende, altijd actieve agents. 2
Dat kan aantrekkelijk zijn voor een agent die vaak moet reageren of operationele lussen herhaalt: een gebeurtenis duiden, een toegestane tool aanroepen, de uitkomst controleren en bepalen of hij doorgaat of escaleert. Daarbij zijn actieve parameters per token en aanhoudende generatiesnelheid minstens zo relevant als het totale aantal parameters.
Qwen3.8-27B is daarentegen een dicht (dense) model: alle 27 miljard parameters doen bij ieder token mee. NVIDIA positioneert het naast Nemotron als een sterke Jetson-optie. 1
Een dense model kan passen bij toepassingen met minder beslismomenten, maar waarin elk besluit zwaarder weegt. De keerzijde is dat de volledige netwerkactivatie per token meer rekenwerk kan vragen dan bij een dunner geactiveerd MoE-model.
De praktische conclusie: kies niet alleen op basis van het getal op het modelkaartje. NVIDIA adviseert te benchmarken met de eigen prompts, antwoordlengtes, tools, geheugenlimieten, latentiebudget en beslispatroon. 1
NVIDIA rapporteert de maximale verbetering van 6,28× ten opzichte van BF16 na het combineren van NVFP4 en speculative decoding op Jetson AGX Thor. De beste speculative-decodingconfiguratie verschilde per model: DSpark presteerde volgens NVIDIA het best voor Nemotron 3.5 Lightning, terwijl DFlash2 de beste keuze was voor Qwen3.8-27B. 1
Dat is relevant omdat decoding — het stapsgewijs produceren van uitvoertokens — vaak bepaalt hoe responsief een interactieve agent aanvoelt. Tegelijk zijn er duidelijke grenzen aan de interpretatie: de kwaliteit van het draft-model, acceptatiegraad van tokens, batchgrootte, contextlengte en runtime-instellingen beïnvloeden de feitelijke doorvoer. 1
Een model op het apparaat zelf voorkomt dat iedere redeneeropdracht een netwerkronde naar een extern datacenter nodig heeft. Voor fysieke systemen kan dat minder netwerkgerelateerde vertraging betekenen, werking bij haperende verbindingen en de mogelijkheid om sensorstromen en operationele logs lokaal te houden. NVIDIA richt zich expliciet op situaties waarin datalokaliteit en realtime respons van belang zijn. 1
Dat maakt cloudinfrastructuur niet overbodig. Centrale systemen blijven nuttig voor modeltraining, beheer van een vloot apparaten, grootschalige analyse en taken die meer geheugen of rekenkracht vragen dan lokaal beschikbaar is. De verschuiving is dat een verbinding met een datacenter niet langer voor elke afzonderlijke beslissing in het kritieke pad hoeft te zitten.
NVIDIA noemt onder meer assistenten in voertuigcabines, anomaliedetectie in real time en robots in zware of afgelegen omgevingen. 1
De gemene deler is dat deze systemen lokale context moeten interpreteren en snel genoeg moeten reageren om bruikbaar te zijn. Denk aan:
De beste kandidaten zijn dus niet simpelweg apparaten die een taalmodel kunnen draaien. Het zijn systemen waarin responstijd, datalokaliteit of privacy en robuustheid zonder verbinding directe operationele waarde hebben.
Jetson AGX Thor is NVIDIA’s platform voor veeleisende physical-AI-workloads. Volgens NVIDIA combineert het een Blackwell-GPU met 128 GB geheugen en levert het tot 2.070 FP4 TFLOPS binnen een energie-envelop van 130 W. 3
Dat profiel past bij grotere lokale redeneermodellen, NVFP4 en snelle decoding. AGX Orin blijft relevant voor bestaande embedded toepassingen, terwijl Thor is gericht op zwaardere generatieve en multimodale taken.
Aan de onderkant van het aanbod heeft NVIDIA Jetson Orin Nano 2 aangekondigd, bedoeld voor robotica, bezorg- en inspectiedrones en vision-AI-systemen. De module en ontwikkelkit worden volgens NVIDIA in de eerste helft van 2027 verwacht. 1
Samen wijst dat op een gelaagd Jetson-aanbod: kleinere systemen voor instap-edge-AI, AGX Orin voor volwassen embedded implementaties en AGX Thor voor toepassingen die meer geheugen en rekenkracht nodig hebben voor lokaal generatief redeneren.
NVIDIA beweert niet dat elk geavanceerd model voortaan comfortabel op elke embedded module draait. De bruikbare conclusie is specifieker: compacte redeneermodellen, lokale inzet met vLLM, NVFP4 en speculative decoding kunnen capabele AI-agents haalbaar maken op Jetson-hardware. 1
Voor ontwikkelaars is de volgende stap daarom vooral praktisch: test het beoogde model op het beoogde Jetson-apparaat, met de echte prompts, tools, contextvensters en responstijdeisen van het product. De 6,28×-uitkomst laat het optimalisatiepotentieel zien; de eigen benchmark bepaalt of dat ook een bruikbaar edge-AI-systeem oplevert. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA noemt Nemotron 3.5 Lightning en Qwen3.8 27B geschikte modellen voor lokale inzet op Jetson AGX Orin en AGX Thor.
NVIDIA noemt Nemotron 3.5 Lightning en Qwen3.8 27B geschikte modellen voor lokale inzet op Jetson AGX Orin en AGX Thor. Op Jetson AGX Thor leverde NVFP4 samen met speculative decoding in NVIDIA’s benchmark tot 6,28× meer decode doorvoer op dan BF16.
Lokale inferentie kan netwerkafhankelijkheid verminderen, maar de uiteindelijke keuze blijft afhankelijk van de echte prompts, tools, geheugenlimieten en latentiedoelen.