Lightning julkaistiin BF16- ja NVFP4-muodoissa. NVIDIA:n materiaalien mukaan sen hybridirakenne yhdistää Mamba- tai tila-avaruustyyppistä käsittelyä, huomiomekanismin ja reititetyt asiantuntijat. NVFP4-versio on tarkoitettu erityisesti päättelykäyttöön, kun taas BF16-versio soveltuu paremmin esimerkiksi mallin mukauttamiseen.
Lightningin vahvin käyttötapaus ei ole toimia yksinään, vaan osana usean mallin järjestelmää. Tyypillinen työnjako voisi näyttää tältä:
NVIDIA:n Nemotron 3 Ultra on tämän vertailuparin toinen pää: kyseessä on 550B:n kokonaismalli, jossa on 55B aktiivista parametria, ja se on tarkoitettu vaativaan päättelyyn ja agenttien orkestrointiin.
Ajatus on käytännöllinen. Kaikkein älykkäintä mallia ei tarvitse käyttää jokaiseen tietojen siirtämiseen, tarkistukseen tai työkalukutsuun. Rutiinityöt voidaan antaa nopeammalle ja edullisemmalle mallille, kun taas vaikeat päätökset ohjataan suuremmalle mallille.
Tällainen työnjako tarvitsee reitityskerroksen. Järjestelmän on päätettävä, lähetetäänkö pyyntö Lightningille vai tehokkaammalle mallille.
NVIDIA:n NeMo Switchyard on palveluntarjoajasta riippumaton SDK, jonka avulla pyynnöt voidaan kuvata, käytettävissä olevat mallikohteet määritellä ja kutsut ohjata valitulle mallille tai palveluntarjoajalle.
Tämä vahvistaa Lightningin asemaa arkkitehtuurin osana. Sen tärkein rooli ei ole olla yksittäinen chatbot, vaan yksi taso reititetyssä agenttijärjestelmässä, jossa eri mallit tekevät niille sopivimmat tehtävät.
Lightningille ilmoitetaan jopa miljoonan tokenin konteksti. Se voi olla hyödyllinen agenteille, jotka käsittelevät pitkiä asiakirjoja, ylläpitävät keskusteluhistoriaa tai kantavat mukanaan paljon tehtävän tilaa. Käytännössä hyödynnettävä kontekstipituus ja suorituskyky riippuvat palvelinohjelmistosta ja asetuksista.
Mallista on saatavilla NVFP4-tarkistuspiste, ja NVIDIA kertoo sen käyttävän erikoistuneita ytimiä tuetuilla Blackwell-, Hopper- ja Ampere-sukupolvien grafiikkasuorittimilla. Käyttöönotto on mahdollista paikallisessa infrastruktuurissa, työasemilla, datakeskuksissa ja pilvipalveluissa. Malli on saatavilla myös Hugging Facessa ja isännöidyissä palveluissa.
AWS:n mukaan Nemotron 3.5 Lightning on saatavilla Amazon SageMaker JumpStartissa. Mallin voi ottaa käyttöön SageMaker-konsolista tai Python SDK:n kautta. NVIDIA:n NIM-dokumentaatio tarjoaa erillisen konttipohjaisen vaihtoehdon, joka edellyttää muun muassa Ubuntu 22.04 -käyttöjärjestelmää tai uudempaa suositeltua versiota, CUDA 12.9:ää tai uudempaa, vähintään 580-version näytönohjainajuria ja Dockeria.
Yhden näytönohjaimen käyttöä koskeviin lupauksiin kannattaa silti suhtautua tarkasti. Kvantisoitu malli voi helpottaa käyttöönottoa, mutta todellinen laitteistovaatimus riippuu näytönohjaimesta, muistista, kontekstin pituudesta, kvantisointimenetelmästä, eräkoosta ja palvelinohjelmistosta. Yksittäisiä laitteita koskevia tuloksia ei voi automaattisesti yleistää kaikkiin kannettaviin tai pöytäkoneisiin.
NVIDIA ja AWS ilmoittavat kohdennetuille agenttityökuormille jopa nelinkertaisen läpimenon ja jopa 30 prosenttia nopeamman tehtävien valmistumisen. Luvut eivät ole yleispätevä mittari mallin älykkyydelle eivätkä takaa samaa tuotantonopeutta kaikissa ympäristöissä.
Tuloksiin vaikuttavat muun muassa:
Siksi Lightningia pitäisi arvioida ennen kaikkea todellisessa työnkulussa: kuinka tarkasti se poimii tiedot, kutsuu työkaluja, tuottaa vaaditun rakenteisen tulosteen ja suorittaa koko tehtävän alusta loppuun. Pelkkä tokenia sekunnissa -luku ei riitä.
Isännöitynä Lightning voi olla kiinnostava vaihtoehto suurta kutsumäärää käsitteleville sovelluksille. DeepInfra ilmoittaa hinnaksi 0,05 Yhdysvaltain dollaria miljoonalta syötetokenilta ja 0,20 dollaria miljoonalta tulostokenilta. Palvelu on käyttömäärään perustuva, eikä käyttäjän tarvitse hallita omaa GPU-infrastruktuuria.
Hinta ei kuitenkaan ole mallin pysyvä ominaisuus. Eri palveluntarjoajat ovat ilmoittaneet toisistaan poikkeavia hintoja, ja kokonaiskustannuksiin vaikuttavat myös käytetty tarkkuus, välimuistit, reititys, uudelleenyritykset ja työkalukutsut.
Agentin todellista hintaa laskettaessa mukaan on otettava myös ne tilanteet, joissa Lightning ei riitä ja pyyntö täytyy lähettää suuremmalle mallille.
Nemotron 3.5 Lightning on järkevä valinta, kun sovellus tuottaa paljon samanlaisia mallikutsuja ja tehtävät voidaan rajata, erikoistaa tai hienosäätää. Sen 30B:n kokonaiskapasiteetti, noin 3B aktiivista parametria, avoimet mallimateriaalit, NVFP4-vaihtoehto ja useat käyttöönoton reitit on rakennettu rutiininomaisen agenttityön nopeuttamiseen ja halventamiseen.
Se ei kuitenkaan ole universaali korvaaja suurelle orkestrointi- tai päättelymallille. Monimutkainen suunnittelu, epävarma harkinta ja tilanteet, joissa virhe tulee kalliiksi, voivat edelleen edellyttää Nemotron 3 Ultraa tai muuta tehokasta päättelyjärjestelmää.
Käytännön arvio on selkeä: Lightning sopii parhaiten reititetyn agenttipinon matalan viiveen suorituskerrokseksi. NVIDIA:n lupaamat hyödyt ovat kiinnostavia, mutta tuotantokäyttöä varten ne on mitattava juuri siinä työnkulussa, jossa mallia aiotaan käyttää.