NVIDIA lanserte Nemotron 3.5 Lightning 11. august 2026 som en åpen 30B MoE modell med rundt 3B aktive parametere, rettet mot gjentakende oppgaver i AI agenter – ikke kompleks planlegging.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Nvidia’s Nemotron 3.5 Lightning, released on August 11 as a 30-billion-parameter open model for the execution layer of autonomous AI. Article summary: NVIDIA Nemotron 3.5 Lightning is best understood as a high-volume “worker” model for autonomous-agent systems: an open 30B-parameter MoE model that activates roughly 3B parameters per inference step, rather than a model . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Det er lett å lese «30 milliarder parametere» og anta at NVIDIA Nemotron 3.5 Lightning er ment å konkurrere direkte med de største språkmodellene. Det er ikke helt poenget.
Nemotron 3.5 Lightning er først og fremst en utføringsmodell for autonome AI-agenter. Den ble lansert 11. august 2026 og kombinerer 30 milliarder parametere totalt med rundt 3 milliarder aktive parametere i hvert inferenssteg. Målet er å håndtere store mengder gjentakende arbeid raskt og rimelig – ikke å være en universell erstatning for større modeller som brukes til krevende resonnering.
En AI-agent kan bruke mye tid på små, men hyppige operasjoner etter at hovedplanen er lagt: Den må kalle verktøy, hente ut felter fra dokumenter, kontrollere regler, bearbeide data og formatere svaret.
Det er denne delen av arbeidsflyten Lightning er laget for. En større modell kan fortsatt tolke målet, lage planen og ta avgjørelser når situasjonen blir uklar. Lightning kan deretter gjøre det forutsigbare arbeidet som gjentas hundrevis eller tusenvis av ganger.
NVIDIA beskriver Nemotron-familien som åpen med hensyn til modellvekter, treningsdata og oppskrifter. Det gir utviklere mulighet til å evaluere og tilpasse modellene før de settes i produksjon.
Lightning er en Mixture-of-Experts-modell, ofte forkortet MoE. I stedet for å bruke hele nettverket for hvert eneste token, rutes hver beregning til et mindre utvalg av eksperter.
Tallene beskriver derfor to ulike ting:
Denne sparsomme kjøringen kan redusere beregningsbehovet per token sammenlignet med en tett modell i samme størrelsesklasse. Den gjør imidlertid ikke hele modellen unødvendig å lagre eller administrere; alle parameterne må fortsatt være tilgjengelige i systemet.
Modellen leveres i BF16- og NVFP4-format. NVIDIA-materiale beskriver også en hybrid arkitektur som kombinerer Mamba- eller tilstandsromprosessering, oppmerksomhetslag og rutede eksperter. Hensikten er å kombinere høy kapasitet med lavere aktiv beregning per steg.
Den praktiske arkitekturen er en arbeidsdeling mellom modeller:
NVIDIA setter dette opp mot Nemotron 3 Ultra, en MoE-modell med 550 milliarder parametere totalt og 55 milliarder aktive parametere, som er posisjonert for avansert resonnering og orkestrering.
Det er også her Lightning har sin tydeligste rolle: Den er mest interessant som en komponent i en rutet modellstakk, ikke som en frittstående chatbot som skal gjøre alt alene.
En agent trenger en måte å velge riktig modell for hvert steg. Hvis alle forespørsler sendes til den største modellen, kan både svartid og kostnader øke unødvendig.
NVIDIAs NeMo Switchyard er et leverandøruavhengig SDK for ruting. Det kan representere forespørsler, definere tilgjengelige modellmål og håndtere kallene til valgt leverandør eller modell-ID.
I praksis kan dette brukes til å bygge et hierarki der Lightning håndterer standardiserte oppgaver, mens en større modell tar over når saken krever mer kapasitet. Det er en viktig del av produktideen rundt Lightning: Verdien oppstår i samspillet mellom modellene og rutingen mellom dem.
Lightning markedsføres med støtte for opptil 1 million token i kontekst. Det kan være nyttig for agenter som holder lange samtaler i gang, arbeider med store dokumenter eller beholder mye tilstand over tid. Hvor mye av dette som faktisk kan brukes, avhenger av serveringsløsningen og konfigurasjonen.
NVFP4-sjekkpunktet er laget for inferens og bruker spesialiserte NVIDIA-kjerner på støttede GPU-generasjoner. NVIDIA oppgir at modellen kan kjøres på lokal infrastruktur, arbeidsstasjoner, i datasentre og i skyen. Den er også tilgjengelig via Hugging Face og ulike driftstjenester.
AWS oppgir at Nemotron 3.5 Lightning er tilgjengelig gjennom SageMaker JumpStart, der modellen kan distribueres via SageMaker-konsollen eller Python-SDK-et. NVIDIA tilbyr i tillegg en separat, containerbasert NIM-løsning med konkrete krav til operativsystem, CUDA, drivere og Docker.
Det betyr likevel ikke at modellen uten videre kan kjøres på hvilken som helst bærbar eller stasjonær PC. Hvorvidt én GPU er tilstrekkelig, avhenger blant annet av GPU-minne, kontekstlengde, kvantisering, batch-størrelse og programvaren som brukes til servering.
NVIDIA og AWS oppgir opptil fire ganger høyere gjennomstrømming og opptil 30 prosent raskere oppgavefullføring for utvalgte agentarbeidslaster. Dette er ikke universelle mål på modellens intelligens eller en garanti for tilsvarende ytelse i produksjon.
Resultatet kan variere med:
En reell evaluering bør derfor se på hele arbeidsflyten: Hvor presist hentes data ut? Hvor pålitelig kalles verktøyene? Følger modellen kravene til strukturert output? Hvor lang tid tar oppgaven fra start til slutt? Tokens per sekund alene gir ikke hele bildet.
Hosted bruk kan gjøre Lightning attraktiv for inferens med høyt volum. DeepInfra oppgir en pris på 0,05 dollar per million input-token og 0,20 dollar per million output-token, med betaling etter bruk og uten at kunden trenger å drifte egne GPU-instanser.
Dette er imidlertid en leverandørspesifikk pris, ikke en fast egenskap ved modellen. Andre tjenester har oppgitt andre satser, og den reelle kostnaden påvirkes også av presisjon, caching og hvilken rute som brukes.
Ved sammenligning med større modeller bør man derfor regne på hele agentarbeidsflyten – inkludert nye forsøk, verktøykall, ruting og de forespørslene som fortsatt må sendes til en kraftigere modell.
Nemotron 3.5 Lightning gir mest mening som en rask og tilpasningsbar arbeidsmodell for agentsystemer med mange like forespørsler. Den kan være særlig nyttig når oppgavene er spesialiserte, avgrensede eller egnet for videre trening.
Den er ikke presentert som en universell erstatning for en stor orkestreringsmodell. Komplisert planlegging, skjønnsmessige vurderinger og oppgaver der feil får store konsekvenser, vil fortsatt kunne kreve Nemotron 3 Ultra eller en annen avansert modell.
Den praktiske vurderingen er derfor enkel: Lightning er en lavforsinkelsesmodell for utføringslaget i en rutet agentstakk. De 30 milliardene totale parameterne, rundt 3 milliarder aktive parameterne, åpne modellmaterialene, NVFP4-alternativet og flere distribusjonsveier er ment å gjøre rutinearbeid billigere og raskere. Men før lovede gevinster blir behandlet som produksjonsresultater, bør de testes mot den konkrete agenten som skal bruke modellen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA lanserte Nemotron 3.5 Lightning 11. august 2026 som en åpen 30B MoE modell med rundt 3B aktive parametere, rettet mot gjentakende oppgaver i AI agenter – ikke kompleks planlegging.
NVIDIA lanserte Nemotron 3.5 Lightning 11. august 2026 som en åpen 30B MoE modell med rundt 3B aktive parametere, rettet mot gjentakende oppgaver i AI agenter – ikke kompleks planlegging. Den hybride arkitekturen, NVFP4 versjonen og kontekstvinduet på opptil 1 million token er utviklet for effektiv kjøring lokalt, i datasentre og i skyen, men ytelsestallene er leverandørens egne påstander.
Den mest interessante bruken er i et system med to modeller: En større modell planlegger og håndterer vanskelige avgjørelser, mens Lightning utfører verktøykall, uthenting, kontroller og formatering.