Nvidia pekar ut Nemotron 3.5 Lightning och Qwen3.8 27B som modeller för lokal körning på Jetson AGX Orin och AGX Thor, med vLLM som serveringslager. På Jetson AGX Thor gav kombinationen NVFP4 och spekulativ avkodning upp till 6,28 gånger högre avkodningskapacitet än BF16 i Nvidias test – ett resultat som beror på mo...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Att köra AI-modeller som kan resonera i flera steg direkt i en inbyggd dator har länge inneburit en svår kompromiss: antingen en enklare modell eller för långsamma svar. Nvidias utvecklarguide från den 4 september pekar på att den avvägningen håller på att förändras. Med optimerade öppna modeller, inferens med låg precision och snabbare tokenavkodning kan resonemangs- och agentbaserad AI köras lokalt på Jetson AGX Orin och Jetson AGX Thor. 1
Det mest uppseendeväckande testresultatet gäller Jetson AGX Thor: Nvidia uppger upp till 6,28 gånger högre avkodningskapacitet än BF16 när NVFP4-kvantisering kombineras med spekulativ avkodning. Det är inte ett generellt löfte om ett visst antal token per sekund, utan ett resultat för specifika modeller och arbetslaster. Men det visar varför lokala AI-agenter blir mer realistiska i robotar, fordon och industriutrustning. 1
Nvidia lyfter fram Nemotron 3.5 Lightning och Qwen3.8-27B som starka alternativ för Jetson AGX Orin och Jetson AGX Thor. Modellerna kan serveras lokalt med vLLM och accelereras med två kompletterande metoder. 1
NVFP4 använder fyrbitars flyttalsrepresentationer för att minska minnesbehovet och beräkningsarbetet i modellens operationer. För inbyggda system är det viktigt: flaskhalsen handlar ofta inte enbart om rå beräkningskraft, utan om hur snabbt modellvikter och aktiveringar kan flyttas under textgenereringen. 1
Jetson Thor är särskilt anpassad för detta, eftersom Nvidias Blackwell-GPU har inbyggt stöd för FP4 via Transformer Engine. 3
Vid spekulativ avkodning föreslår en mindre utkastmodell flera kommande token. Huvudmodellen granskar dem sedan tillsammans och fattar fortfarande det slutliga beslutet. När flera förslag godkänns kan genereringen gå framåt flera token i samma granskningssteg, i stället för ett token i taget. 1
Vinsten beror på hur ofta huvudmodellen accepterar utkastmodellens förslag. Därför varierar resultatet med modell, prompt och avkodningsinställningar. Tekniken bör ses som en optimering för en viss arbetslast, inte som en fast prestandamultiplikator.
Nemotron 3.5 Lightning är en mixture-of-experts-modell (MoE) med 30 miljarder parametrar, men bara 3 miljarder parametrar aktiveras per token. Nvidia beskriver den som en modell för exekveringslagret i långvariga, ständigt aktiva agenter. 2
Det kan passa en agent som ofta behöver agera i operativa slingor: tolka en händelse, använda ett godkänt verktyg, kontrollera resultatet och avgöra om arbetet ska fortsätta eller eskaleras. För sådana system är inte det totala parameterantalet det enda viktiga, utan antalet aktiva parametrar per token och uthållig genereringshastighet.
Qwen3.8-27B är en tät modell, vilket innebär att samtliga 27 miljarder parametrar deltar för varje token. Nvidia placerar modellen som ett kraftfullt Jetson-alternativ vid sidan av Nemotron 3.5 Lightning. 1
En tät modell kan vara ett rimligt val när systemet fattar färre beslut, men varje beslut väger tyngre. Nackdelen är att hela nätverket aktiveras för varje token, vilket kan kräva mer beräkningskraft än en gles MoE-modell.
Nvidias praktiska råd är att testa mot den verkliga applikationen: promptarnas och svarens längd, verktygsanrop, svarstidskrav, minnesgränser och hur ofta systemet måste fatta beslut. 1
En agent med många korta svar kan gynnas av en gles modell med snabb utmatning. Ett system med färre men mer komplexa bedömningar kan i stället acceptera långsammare generering. Ingen av arkitekturerna är automatiskt bäst för alla edge-installationer.
Nvidia rapporterar en maximal förbättring av avkodningskapaciteten på 6,28 gånger jämfört med BF16 på Jetson AGX Thor, efter att NVFP4 och spekulativ avkodning kombinerats. Den bästa konfigurationen för spekulativ avkodning skilde sig mellan modellerna: DSpark fungerade bäst för Nemotron 3.5 Lightning, medan DFlash2 fungerade bäst för Qwen3.8-27B. 1
Det är betydelsefullt eftersom avkodningen – den stegvisa framtagningen av utdata-token – ofta avgör hur snabb en interaktiv agent upplevs. Men siffran ska inte läsas som ett allmänt prestandalöfte. Utkastmodellens kvalitet, acceptansgraden för token, batchstorlek, kontextlängd och körmiljöns inställningar påverkar genomströmningen i praktiken. 1
När modellen körs på själva enheten behöver varje resonemangsförfrågan inte gå via ett fjärranslutet datacenter. För fysiska system kan det innebära mindre nätverksrelaterad fördröjning, fortsatt funktion vid instabil uppkoppling och möjlighet att hålla sensordata och driftloggar lokalt. Nvidia framhåller särskilt resonemangs-AI vid kanten när datalokalitet och svar i realtid är viktiga. 1
Det betyder inte att molnet blir överflödigt. Centraliserad infrastruktur kan fortfarande användas för modellträning, hantering av enhetsflottor, storskalig analys och uppgifter som överskrider enhetens minne eller beräkningskapacitet. Förändringen är att kontakten med datacentret inte längre måste ligga i den kritiska vägen för varje beslut.
Nvidia nämner assistenter i fordonskupéer, anomalidetektering i realtid och robotar som arbetar i tuffa eller avlägsna miljöer. 1
Gemensamt för dessa tillämpningar är att systemet måste förstå sin lokala situation och reagera snabbt nog för att vara användbart. Exempel är:
De bästa kandidaterna är alltså inte bara enheter som kan köra en språkmodell. De är system där svarstid, datalokalitet eller tålighet mot avbrott i uppkopplingen har ett direkt verksamhetsvärde.
Jetson AGX Thor är Nvidias toppplattform för krävande arbetslaster inom fysisk AI. Enligt Nvidia kombinerar den en Blackwell-GPU med 128 GB minne och levererar upp till 2 070 FP4 TFLOPS inom en effektbudget på 130 W. 3
Det passar väl med guidens fokus på NVFP4, snabb avkodning och större resonemangsmodeller på enheten. AGX Orin är fortsatt relevant för etablerade inbyggda installationer, medan Thor riktar sig mot mer krävande generativa och multimodala arbetslaster.
I instegssegmentet har Nvidia också annonserat Jetson Orin Nano 2 för robotik, leverans- och inspektionsdrönare samt visuella AI-system. Modulen och utvecklingskitet väntas under första halvåret 2027. 1
Sammantaget pekar produktlinjen mot en nivåindelad strategi: mindre system för enklare edge-AI, AGX Orin för mogna inbyggda lösningar och AGX Thor för installationer som behöver mer minne och beräkningskraft för lokalt generativt resonemang.
Nvidias guide säger inte att alla de största AI-modellerna nu kan köras obehindrat på varje inbyggd modul. Poängen är mer konkret: kompakta resonemangsmodeller, vLLM, NVFP4-kvantisering och spekulativ avkodning kan göra kapabla lokala AI-agenter praktiskt genomförbara på Jetson-hårdvara. 1
Nästa steg för utvecklare är därför empiriskt: testa målmodellen på den aktuella Jetson-enheten med produktens riktiga promptar, verktyg, kontextfönster och krav på svarstid. Resultatet på 6,28 gånger visar potentialen i optimering – men det är applikationens eget benchmark som avgör om den blir ett användbart edge-AI-system. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia pekar ut Nemotron 3.5 Lightning och Qwen3.8 27B som modeller för lokal körning på Jetson AGX Orin och AGX Thor, med vLLM som serveringslager.
Nvidia pekar ut Nemotron 3.5 Lightning och Qwen3.8 27B som modeller för lokal körning på Jetson AGX Orin och AGX Thor, med vLLM som serveringslager. På Jetson AGX Thor gav kombinationen NVFP4 och spekulativ avkodning upp till 6,28 gånger högre avkodningskapacitet än BF16 i Nvidias test – ett resultat som beror på modell och arbetslast.
Lokal inferens kan minska beroendet av nätanslutning för robotar, fordon och industrisystem, men valet av modell måste testas mot den faktiska produktens svarstider, minnesgränser och arbetsflöden.