Nemotron 3.5 Lightning, uvedený 11. srpna 2026, je otevřený MoE model s 30 miliardami parametrů, z nichž při jednom kroku aktivuje přibližně 3 miliardy.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Nvidia’s Nemotron 3.5 Lightning, released on August 11 as a 30-billion-parameter open model for the execution layer of autonomous AI. Article summary: NVIDIA Nemotron 3.5 Lightning is best understood as a high-volume “worker” model for autonomous-agent systems: an open 30B-parameter MoE model that activates roughly 3B parameters per inference step, rather than a model . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA Nemotron 3.5 Lightning je specializovaný výkonný model pro autonomní AI agenty. NVIDIA jej uvedla 11. srpna 2026 jako otevřený model s 30 miliardami parametrů, který při každém kroku generování aktivuje přibližně 3 miliardy parametrů. Nejde tedy o univerzální náhradu největších modelů, ale o model pro rychlou a opakovanou práci ve velkém objemu.
To je klíč k pochopení celého návrhu. Agent může na začátku potřebovat silný model, aby rozebral zadání a sestavil plán. Potom ale často následují desítky či stovky menších operací: volání nástrojů, vytěžování polí z dokumentů, kontrola pravidel, převod dat nebo úprava výsledného formátu. Právě tuto exekuční vrstvu má Lightning obsloužit rychleji a levněji.
Lightning je otevřený 30B model typu Mixture of Experts (MoE), vyvinutý pro specializované úkoly v dlouhodobě běžících agentech. NVIDIA označuje rodinu Nemotron za otevřenou z hlediska vah, trénovacích dat i postupů, takže vývojáři mohou model před nasazením vyhodnotit a upravit.
Model je dostupný ve formátech BF16 a NVFP4. Materiály NVIDIA a související modelová dokumentace popisují hybridní architekturu kombinující zpracování typu state space/Mamba, attention a směrované experty. Cílem je nabídnout kapacitu většího modelu, aniž by se při každém tokenu aktivovala celá síť.
Označení „30B“ a „3B aktivních“ popisují dvě různé věci:
Díky řídkému výpočtu může model patřit do vyšší velikostní kategorie, ale při generování se chovat podobně jako výrazně menší aktivní síť. Neznamená to, že není nutné řešit uložení nebo správu celého modelu. Výhodou je především nižší výpočetní náročnost na generovaný token.
Autonomní agenti obvykle vytvářejí velké množství modelových požadavků. Po úvodním naplánování úkolu mohou opakovaně vybírat nástroje, číst strukturovaná data, ověřovat výsledek a převádět jej do požadovaného formátu.
Posílat každý takový požadavek k největšímu dostupnému modelu zvyšuje latenci i provozní náklady. Lightning má převzít předvídatelnou a často se opakující část práce, zatímco schopnější model zůstane k dispozici pro nejasná rozhodnutí a náročné uvažování.
Typická dvouvrstvá architektura může vypadat následovně:
NVIDIA staví Lightning do kontrastu s modelem Nemotron 3 Ultra, který má celkem 550 miliard parametrů a 55 miliard aktivních parametrů a je určený pro špičkové uvažování a orchestrace agentů.
Taková sestava potřebuje směrování. Agent musí umět rozhodnout, který model zpracuje konkrétní krok, místo aby každý požadavek posílal na stejný endpoint.
NeMo Switchyard je SDK pro směrování požadavků mezi poskytovateli a modely. Umožňuje popsat požadavek, definovat dostupné cíle a spravovat volání vybraného poskytovatele nebo ID modelu. V praxi tak lze vytvořit hierarchii, v níž Lightning řeší rutinní volání a větší model dostává případy vyžadující vyšší schopnosti.
To je důležitý architektonický detail: Lightning dává největší smysl jako součást směrovaného vícemodelového systému, nikoli jako izolovaný chatbot.
Lightning je uváděn s kapacitou kontextu až 1 milion tokenů. To může být užitečné u agentů, kteří udržují dlouhé pracovní relace, zpracovávají rozsáhlé dokumenty nebo opakovaně pracují s velkým stavem úlohy. Skutečně využitelná délka kontextu a výkon ale závisí na konfiguraci a použitém servingovém stacku.
Checkpoint NVFP4 je určený pro inferenci a využívá specializovaná jádra NVIDIA na podporovaných generacích GPU. NVIDIA model nabízí pro lokální infrastrukturu, pracovní stanice, datová centra i cloud; dostupný je také přes Hugging Face a hostované služby.
AWS uvádí dostupnost Nemotronu 3.5 Lightning v katalogu SageMaker JumpStart. Nasazení lze provést prostřednictvím konzole Amazon SageMaker nebo pomocí Python SDK. Samostatnou možnost představuje kontejnerizované nasazení přes NVIDIA NIM, které vyžaduje konkrétní verze operačního systému, CUDA, ovladačů a Dockeru.
Hardwarové nároky je ale třeba posuzovat střízlivě. Kvantizovaný checkpoint může nasazení usnadnit, avšak možnost provozu na jediné GPU závisí na konkrétní kartě, dostupné paměti, délce kontextu, kvantizační cestě, dávkování i použitém softwaru. Tvrzení o přesných úsporách úložiště nebo široké podpoře spotřebitelských GeForce RTX proto nelze automaticky vztáhnout na každý notebook či stolní počítač.
NVIDIA a AWS uvádějí až čtyřnásobně vyšší propustnost a až o 30 % rychlejší dokončení úloh u vybraných agentních pracovních zátěží. Nejde o univerzální měřítko inteligence modelu ani o záruku stejného výkonu v produkci.
Výsledek se může výrazně změnit podle:
Lightning proto dává smysl testovat na metrikách konkrétního agenta: přesnosti extrakce, spolehlivosti volání nástrojů, dodržování strukturovaného výstupu a celkové době dokončení. Samotný údaj o počtu tokenů za sekundu nestačí.
Hostované API může být pro vysoký objem inference zajímavé. DeepInfra uvádí cenu 0,05 dolaru za 1 milion vstupních tokenů a 0,20 dolaru za 1 milion výstupních tokenů. Služba je účtována podle využití a nevyžaduje správu vlastní GPU infrastruktury.
Tato částka ale není trvalou vlastností modelu. Jiní poskytovatelé uvádějí jiné sazby a výsledné náklady ovlivňuje poskytovatel, přesnost, cache i konkrétní směrovací cesta. Při porovnávání s většími modely je proto nutné započítat celý workflow včetně opakovaných pokusů, volání nástrojů, směrování a požadavků, které stále vyžadují schopnější model.
Nemotron 3.5 Lightning je nejlepší chápat jako rychlý a upravitelný pracovní model pro agentní systémy. Hodí se tam, kde aplikace generuje mnoho podobných požadavků a kde lze úkol přesně specifikovat, omezit pravidly nebo model dodatečně dotrénovat.
Není prezentován jako univerzální náhrada velkého orchestration modelu. Komplexní plánování, nejistý úsudek a úlohy s vysokou cenou chyby mohou nadále vyžadovat větší model, například Nemotron 3 Ultra, nebo jiný systém špičkové úrovně.
Praktický závěr je jednoduchý: Lightning dává největší smysl jako nízkolatenční exekuční vrstva ve směrovaném agentním stacku. Celková kapacita 30 miliard parametrů, přibližně 3 miliardy aktivních parametrů, otevřené materiály, možnost kvantizované inference a několik cest nasazení míří na to, aby běžná práce agentů byla rychlejší a levnější. Deklarované přínosy jsou zajímavé, ale před produkčním nasazením je nutné je ověřit na vlastním workflow.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nemotron 3.5 Lightning, uvedený 11. srpna 2026, je otevřený MoE model s 30 miliardami parametrů, z nichž při jednom kroku aktivuje přibližně 3 miliardy.
Nemotron 3.5 Lightning, uvedený 11. srpna 2026, je otevřený MoE model s 30 miliardami parametrů, z nichž při jednom kroku aktivuje přibližně 3 miliardy. Hybridní architektura, formáty BF16 a NVFP4 a kontext až 1 milion tokenů cílí na rychlé nasazení v lokální infrastruktuře, datových centrech i cloudu.
Nejlogičtější použití je ve dvouvrstvé sestavě: větší model řeší složitá rozhodnutí a Lightning obstarává volání nástrojů, extrakci dat, kontroly pravidel a formátování výstupů.