Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Resonnerende modeller som arbeider i flere trinn, har lenge vært vanskelige å få til å fungere godt på innebygde systemer. Vanligvis har man måttet velge mellom modellkapasitet og rask respons. I en utviklerguide publisert 4. september viser NVIDIA hvordan optimaliserte, åpne modeller, lavere presisjon og raskere dekoding kan gjøre lokale KI-agenter praktiske på modulene Jetson AGX Orin og Jetson AGX Thor. 1
Det mest iøynefallende tallet er opptil 6,28 ganger høyere dekodegjennomstrømning enn BF16 på Jetson AGX Thor når NVFP4-kvantisering kombineres med spekulativ dekoding. Dette er et resultat fra NVIDIAs test av bestemte modeller og arbeidslaster – ikke en generell garanti for antall token per sekund. Likevel illustrerer det hvorfor lokale KI-agenter blir mer aktuelle i roboter, kjøretøy og industrielt utstyr. 1
NVIDIA peker på Nemotron 3.5 Lightning og Qwen3.8-27B som relevante modeller for Jetson AGX Orin og Jetson AGX Thor. Modellene kan betjenes lokalt med vLLM, et rammeverk for effektiv inferens av språkmodeller. Deretter kan to teknikker brukes sammen for å hente ut mer ytelse. 1
NVFP4 bruker flyttall med fire bits presisjon for å redusere minnebehovet og beregningsarbeidet i modelloperasjonene. For innebygde systemer er ikke begrensningen bare rå regnekraft; det er også hvor raskt modellvekter og aktiveringer kan flyttes gjennom minnet under tekstgenerering. 1
Jetson Thor er spesielt tilpasset denne typen optimalisering, ifølge NVIDIA, fordi Blackwell-GPU-en har innebygd støtte for FP4 gjennom Transformer Engine. 3
Spekulativ dekoding deler arbeidet i forslag og kontroll. En mindre utkastmodell foreslår flere neste token, mens hovedmodellen verifiserer dem samlet og fortsatt tar den endelige avgjørelsen. Når flere forslag godtas, kan genereringen gå fremover med flere token i ett kontrollsteg i stedet for ett om gangen. 1
Gevinsten avhenger av hvor ofte utkastmodellens token blir akseptert. Den vil derfor variere med modell, spørsmål og dekodeoppsett. Spekulativ dekoding bør ses som en optimalisering for en bestemt arbeidslast, ikke som en fast ytelsesfaktor.
Nemotron 3.5 Lightning er en mixture-of-experts-modell (MoE) med 30 milliarder parametere, men den aktiverer bare 3 milliarder parametere per token. NVIDIA beskriver den som laget for utførelseslaget i langvarige, kontinuerlig aktive agenter. 2
En slik arkitektur kan passe når en agent ofte må generere svar eller gjenta operative sløyfer: tolke en hendelse, bruke et godkjent verktøy, undersøke resultatet og avgjøre om den skal fortsette eller varsle et menneske. Da betyr aktive parametere per token og vedvarende genereringshastighet mye – ikke bare totalt parameterantall.
Qwen3.8-27B er en tett modell, altså en modell der alle 27 milliarder parameterne brukes for hvert token. NVIDIA fremhever den som et sterkt alternativ på Jetson ved siden av Nemotron 3.5 Lightning. 1
En tett modell kan være aktuell når systemet tar færre beslutninger, men hver beslutning har høyere verdi. Ulempen er at det kan kreve mer beregning per token å aktivere hele nettverket enn å bruke en sparsom MoE-modell.
NVIDIAs råd er i praksis å teste mot den reelle applikasjonen: lengden på spørsmål og svar, verktøyene agenten bruker, ventetidsbudsjettet, minnegrensene og beslutningsmønsteret. 1
En agent som produserer mange svar, kan ha fordel av en sparsom modell med rask utdata. Et system som tar færre, men vanskeligere avgjørelser, kan heller akseptere lavere genereringshastighet for egenskapene en tett modell gir. Ingen av arkitekturene er automatisk best i alle kantdistribusjoner.
NVIDIA rapporterer en maksimal forbedring på 6,28× i dekodegjennomstrømning sammenlignet med BF16 ved å kombinere NVFP4 og spekulativ dekoding på Jetson AGX Thor. Det beste spekulative dekodeoppsettet var ulikt for de to modellene: DSpark fungerte best for Nemotron 3.5 Lightning, mens DFlash2 fungerte best for Qwen3.8-27B. 1
Tallet er viktig fordi dekoding – den trinnvise produksjonen av token i svaret – ofte avgjør hvor responsiv en interaktiv agent oppleves. Men det må ikke leses som et generelt hastighetsløfte. Kvaliteten på utkastmodellen, akseptraten, batchstørrelsen, kontekstlengden og runtime-oppsettet påvirker gjennomstrømningen i praksis. 1
Når modellen kjører på selve enheten, trenger ikke hver resonneringsoppgave en rundtur til et eksternt datasenter. For fysiske systemer kan det bety mindre nettverksrelatert forsinkelse, fortsatt drift når forbindelsen er ustabil, og at sensorstrømmer og driftslogger kan beholdes på enheten. NVIDIA trekker særlig frem situasjoner der datalokalitet og respons i sanntid er viktige. 1
Det betyr ikke at nettskyen blir overflødig. Sentrale systemer kan fortsatt brukes til modelltrening, administrasjon av enhetsflåter, analyser i stor skala og oppgaver som krever mer minne eller regnekraft enn enheten har tilgjengelig. Endringen er at tilkoblingen til et datasenter ikke nødvendigvis må ligge i den kritiske kjeden for hver beslutning.
NVIDIA fremhever assistenter i bilkupéen, sanntidsdeteksjon av avvik og roboter som arbeider i krevende eller avsidesliggende miljøer. 1
Fellesnevneren er at systemet må forstå lokal kontekst og svare raskt nok til å være nyttig. Aktuelle bruksområder kan være:
De beste kandidatene er dermed ikke bare enheter som kan kjøre en språkmodell. Det er systemer der responstid, krav til datalokalitet og robusthet uten nett har tydelig operativ verdi.
Jetson AGX Thor er NVIDIAs toppmodell for krevende arbeidslaster innen fysisk KI. NVIDIA oppgir at plattformen kombinerer en Blackwell-GPU med 128 GB minne og leverer opptil 2 070 FP4-TFLOPS innenfor en effektgrense på 130 W. 3
Dette passer med guidens vekt på NVFP4, rask dekoding og større lokale modeller for resonnering. AGX Orin er fortsatt relevant i etablerte innebygde løsninger, mens Thor er rettet mot mer krevende generative og multimodale arbeidslaster.
I innstegssegmentet har NVIDIA også varslet Jetson Orin Nano 2 for robotikk, leverings- og inspeksjonsdroner og synsbaserte KI-systemer. Selskapet oppgir at modulen og utviklersettet er ventet i første halvår 2027. 1
Porteføljen peker dermed mot en inndelt strategi: mindre systemer for KI ved kanten på innstegsnivå, AGX Orin for modne innebygde distribusjoner og AGX Thor for applikasjoner som trenger mer minne og regnekraft til lokal generativ resonnering.
NVIDIAs guide sier ikke at enhver toppmodell nå kan kjøre komfortabelt på enhver innebygd modul. Den mer konkrete konklusjonen er at kompakte resonneringsmodeller, vLLM, NVFP4-kvantisering og spekulativ dekoding kan gjøre kapable lokale agenter mulig på Jetson-maskinvare. 1
For utviklere er neste steg derfor praktisk testing: Kjør målmodellen på den aktuelle Jetson-enheten med de faktiske spørsmålene, verktøyene, kontekstvinduene og responstidskravene produktet skal håndtere. Resultatet på 6,28× viser potensialet i optimalisering; applikasjonens egen måling avgjør om det blir et brukbart kant-KI-system. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA oppgir at Jetson AGX Thor og AGX Orin kan kjøre Nemotron 3.5 Lightning og Qwen3.8 27B lokalt.
NVIDIA oppgir at Jetson AGX Thor og AGX Orin kan kjøre Nemotron 3.5 Lightning og Qwen3.8 27B lokalt. Nemotron 3.5 Lightning er en MoE modell med 30 milliarder parametere, men bare 3 milliarder aktive per token.
Lokal inferens kan redusere avhengigheten av nettverk for roboter, kjøretøy og industrisystemer, men utviklere må teste med egne spørsmål, verktøy, ventetidskrav og minnegrenser.