NVIDIA släppte Nemotron 3.5 Lightning den 11 augusti 2026. Modellen har 30 miljarder parametrar totalt, men omkring 3 miljarder aktiveras per inferenssteg och den är byggd för repetitiva uppgifter i AI agenter.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Nvidia’s Nemotron 3.5 Lightning, released on August 11 as a 30-billion-parameter open model for the execution layer of autonomous AI. Article summary: NVIDIA Nemotron 3.5 Lightning is best understood as a high-volume “worker” model for autonomous-agent systems: an open 30B-parameter MoE model that activates roughly 3B parameters per inference step, rather than a model . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA Nemotron 3.5 Lightning är bäst förstådd som en arbetsmodell för autonoma AI-agenter. Den släpptes den 11 augusti 2026 och kombinerar 30 miljarder parametrar totalt med omkring 3 miljarder aktiva parametrar per inferenssteg. Målet är alltså inte att ersätta de största modellerna för avancerat resonemang, utan att snabbt hantera de många mindre uppgifter som en agent utför under ett längre arbetsflöde.
Det kan handla om att välja och anropa verktyg, plocka ut fält ur dokument, kontrollera policyer, omvandla data eller leverera ett svar i rätt strukturerat format. I en långvarig agent är planeringen ofta bara ett av flera steg. Resten består av återkommande operationer där låg latens och låg kostnad kan vara viktigare än maximal generell problemlösningsförmåga.
Lightning är en öppen 30B-modell av typen Mixture of Experts, eller MoE. NVIDIA beskriver Nemotron-familjen som öppen när det gäller modellvikter, träningsdata och träningsrecept, så att utvecklare kan granska och anpassa modellerna före driftsättning.
Modellen finns i formaten BF16 och NVFP4. Materialet beskriver också en hybridarkitektur som kombinerar tillståndsrymds- eller Mamba-liknande bearbetning, attention och routade experter. Tanken är att ge modellen en större total kapacitet utan att hela nätverket behöver aktiveras för varje token.
De två parametrarna betyder olika saker:
Den glesa beräkningen kan minska mängden arbete per genererad token. Däremot försvinner inte behovet av att lagra eller hantera hela modellen. 30B är alltså fortfarande modellens totala storleksklass, medan 3B beskriver den aktiva beräkningsprofilen.
En agent kan behöva göra många modellanrop för att lösa en enda övergripande uppgift. Efter att en större modell har tolkat målet och skapat en plan kan agenten behöva välja verktyg, läsa strukturerad information, verifiera resultat och formatera svaret – ibland tusentals gånger.
Att använda en mycket stor modell för varje sådant anrop kan öka både svarstiden och driftkostnaden. Lightning är i stället tänkt att ta hand om den förutsägbara delen av arbetet, medan en mer kapabel modell kopplas in när agenten stöter på osäkerhet, undantag eller ett beslut som kräver djupare resonemang.
En typisk tvåskiktsarkitektur kan se ut så här:
NVIDIA positionerar Nemotron 3 Ultra – en MoE-modell med 550B parametrar totalt och 55B aktiva parametrar – för avancerat resonemang och orkestrering. Skillnaden mot Lightning är därmed tydlig: Ultra tänker och styr, medan Lightning är byggd för att utföra många återkommande deluppgifter.
Den här uppdelningen kräver ett routingsystem. Agenten måste kunna avgöra när en förfrågan ska skickas till Lightning och när den behöver en större modell.
NVIDIA:s NeMo Switchyard är ett leverantörsoberoende SDK för att beskriva förfrågningar, definiera tillgängliga modellmål och hantera anrop till den modell eller tjänst som väljs. Det gör det möjligt att bygga en modellhierarki där Lightning hanterar rutinärenden och en större modell tar över de fall som kräver mer kapacitet.
Det är också den viktigaste produktpoängen: Lightning är inte främst tänkt som en fristående chatbot. Den passar bäst som en del av ett routat agentsystem med flera modeller.
Lightning marknadsförs med en kontextkapacitet på upp till 1 miljon tokens. Det kan vara relevant för agenter som håller reda på långa arbetsflöden, bearbetar stora dokument eller behöver bära med sig mycket tillstånd över tid. Den praktiskt användbara kontextlängden och hastigheten beror dock på serveringslösning och konfiguration.
NVFP4-checkpointen är avsedd för inferens och använder specialiserade NVIDIA-kärnor på stödda GPU-generationer. NVIDIA listar användning i lokal infrastruktur, arbetsstationer, datacenter och molnmiljöer. Modellen finns även via Hugging Face och olika värdtjänster.
AWS uppger att Nemotron 3.5 Lightning finns i SageMaker JumpStart och kan driftsättas via SageMaker-konsolen eller Python-SDK:t. NVIDIA erbjuder dessutom en separat, containerbaserad NIM-väg med angivna krav på operativsystem, CUDA, drivrutiner och Docker.
Det är ändå klokt att vara försiktig med påståenden om drift på en enda GPU. En kvantiserad modell kan göra serveringen mer praktisk, men genomförbarheten beror bland annat på GPU-minne, kontextlängd, kvantiseringsmetod, batchning och serveringsmjukvara. Exakt hårdvarustöd bör därför kontrolleras mot den aktuella modellbeskrivningen och distributionsreceptet.
NVIDIA och AWS anger upp till fyra gånger högre genomströmning och upp till 30 procent snabbare uppgiftsgenomförande för utvalda agentarbetslaster. Det är inte ett universellt mått på modellens intelligens och inte heller en garanti för samma resultat i produktion.
Utfallet påverkas bland annat av:
Den som utvärderar modellen bör därför mäta det som faktiskt spelar roll för den egna agenten: träffsäkerhet vid extraktion, tillförlitlighet i verktygsanrop, följsamhet till strukturerade utdata och total tid från start till slutfört arbetsflöde – inte bara tokens per sekund.
Värdbaserad inferens kan göra Lightning intressant för högvolymstrafik. DeepInfra listar modellen för 0,05 dollar per miljon indatatokens och 0,20 dollar per miljon utdatatokens, med betalning efter användning och utan att kunden behöver hantera egen GPU-infrastruktur.
Detta är dock ett leverantörspris, inte en permanent egenskap hos modellen. Andra tjänster visar andra nivåer, och precision, cachelagring, routning och vald plattform påverkar den verkliga kostnaden. En rättvis jämförelse med större modeller måste därför även räkna in omförsök, verktygsanrop, routning och de frågor som fortfarande behöver skickas till en mer avancerad modell.
Nemotron 3.5 Lightning bör ses som en snabb och anpassningsbar arbetare i ett agentsystem. Den är särskilt relevant när en applikation gör många liknande modellanrop och när uppgifterna kan begränsas, specialiseras eller eftertränas.
Den är däremot inte presenterad som en universell ersättare för en stor orkestreringsmodell. Komplex planering, osäkra bedömningar och uppgifter där ett fel blir dyrt kan fortfarande kräva Nemotron 3 Ultra eller en annan avancerad modell.
Den praktiska slutsatsen är enkel: Lightning gör mest nytta som lågfördröjningslagret i en routad modellstack. Kombinationen av 30B parametrar totalt, omkring 3B aktiva parametrar, öppna modellmaterial, kvantiserad inferens och flera driftsalternativ är utformad för att göra rutinmässigt agentarbete snabbare och billigare. Men de utlovade vinsterna bör testas mot det faktiska arbetsflödet innan de behandlas som produktionsresultat.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA släppte Nemotron 3.5 Lightning den 11 augusti 2026. Modellen har 30 miljarder parametrar totalt, men omkring 3 miljarder aktiveras per inferenssteg och den är byggd för repetitiva uppgifter i AI agenter.
NVIDIA släppte Nemotron 3.5 Lightning den 11 augusti 2026. Modellen har 30 miljarder parametrar totalt, men omkring 3 miljarder aktiveras per inferenssteg och den är byggd för repetitiva uppgifter i AI agenter. Den hybrida MoE arkitekturen, NVFP4 versionen och den annonserade kontextkapaciteten på upp till 1 miljon tokens är inriktade på snabb och kostnadseffektiv drift, men prestandasiffrorna är leverantörens egna påståenden.
Den mest logiska användningen är en tvådelad modellstack: en större modell planerar och hanterar svåra beslut, medan Lightning utför verktygsanrop, extraktion, kontroller och formatering.