NVIDIA nostaa Jetson AGX Orinin ja AGX Thorin vaihtoehdoiksi Nemotron 3.5 Lightningin ja Qwen3.8 27B:n paikalliseen ajoon. Nemotron 3.5 Lightning on 30 miljardin parametrin MoE malli, josta aktivoituu 3 miljardia parametria tokenia kohti.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Monivaiheiseen päättelyyn kykenevien mallien ajaminen sulautetulla laitteella on aiemmin tarkoittanut yleensä kompromissia: joko mallin kyvykkyydestä tai vasteajasta on pitänyt tinkiä. NVIDIAn 4. syyskuuta julkaisema kehittäjäopas esittää, että tilanne on muuttumassa. Optimoidut avoimet mallit, matalamman tarkkuuden inferenssi ja nopeampi dekoodaus voivat tuoda päättelyä ja itsenäisiä työvaiheita suorittavia tekoälyagentteja suoraan Jetson AGX Orin- ja Jetson AGX Thor -moduuleille. 1
Oppaan keskeisin tulos on Jetson AGX Thorilla mitattu, enimmillään 6,28-kertainen dekoodaussuorituskyky BF16-tarkkuuteen verrattuna, kun NVFP4-kvantisointi ja spekulatiivinen dekoodaus yhdistettiin. Kyse on malli- ja työkuormakohtaisesta vertailusta, ei yleispätevästä lupauksesta tietystä tokenimäärästä sekunnissa. Tulos havainnollistaa silti, miksi paikallisesti toimivat tekoälyagentit ovat aiempaa realistisempi vaihtoehto robotiikassa, ajoneuvoissa ja teollisuuslaitteissa. 1
NVIDIA nimeää Nemotron 3.5 Lightningin ja Qwen3.8-27B:n vahvoiksi vaihtoehdoiksi Jetson AGX Orinille ja Jetson AGX Thorille. Mallit voidaan tarjota Jetsonilla vLLM:n kautta, minkä jälkeen suorituskykyä voidaan parantaa kahdella toisiaan täydentävällä tekniikalla. 1
NVFP4 käyttää nelibittistä liukulukuesitystä mallin laskennassa. Sen tarkoitus on vähentää mallitoimintojen laskentatyötä ja muistitarvetta. Sulautetuissa laitteissa pullonkaula ei ole välttämättä pelkkä laskentateho, vaan myös se, kuinka nopeasti mallin painoja ja aktivaatioita saadaan siirrettyä generoinnin aikana. 1
Jetson Thor sopii tähän erityisen hyvin, sillä NVIDIAn mukaan sen Blackwell-grafiikkasuoritin tukee FP4:ää natiivisti Transformer Engine -teknologian avulla. 3
Spekulatiivisessa dekoodauksessa pienempi luonnosmalli ehdottaa useita seuraavia tokeneita, ja varsinainen päämalli tarkistaa ne kerralla. Päämalli tekee yhä lopullisen päätöksen. Jos se hyväksyy useita ehdotettuja tokeneita, generointi voi edetä yhdellä tarkistusvaiheella usean tokenin verran yhden tokenin sijasta. 1
Hyöty riippuu siitä, kuinka usein päämalli hyväksyy luonnosmallin ehdotukset. Siksi tulos vaihtelee mallin, kehotteen ja dekoodausasetusten mukaan. Spekulatiivista dekoodausta kannattaa pitää työkuormaa optimoivana menetelmänä, ei kiinteänä nopeuskertoimena.
Mallit kuvaavat kahta erilaista reunalaskennan kompromissia.
Nemotron 3.5 Lightning on 30 miljardin parametrin mixture-of-experts- eli MoE-malli. Jokaisella tokenilla aktivoidaan kuitenkin vain 3 miljardia parametria. NVIDIA kuvaa mallia pitkään toimivien, jatkuvasti käynnissä olevien agenttien suorituskerrokseen soveltuvaksi. 2
Tällainen rakenne voi olla eduksi, kun agentin pitää tuottaa vastauksia usein tai kiertää toistuvasti toimintasilmukkaa: tulkita tapahtuma, käyttää sallittua työkalua, arvioida tulos ja päättää jatkosta tai poikkeuksen eskaloinnista. Kokonaisparametrien määrä ei silloin yksin ratkaise, vaan merkittäviä ovat tokenia kohti aktivoituvat parametrit ja jatkuvan generoinnin nopeus.
Qwen3.8-27B on tiheä malli, eli kaikki 27 miljardia parametria osallistuvat jokaisen tokenin käsittelyyn. NVIDIA nostaa sen Nemotron 3.5 Lightningin rinnalle Jetson-vaihtoehdoksi. 1
Tiheä malli voi sopia tilanteisiin, joissa päätöksiä tehdään harvemmin mutta yksittäiseltä päätökseltä vaaditaan enemmän. Vastapainona koko verkon aktivointi tokenia kohden voi vaatia enemmän laskentatehoa kuin harva MoE-arkkitehtuuri.
NVIDIAn käytännön ohje on verrata malleja todelliseen sovellukseen: kehotteiden ja vastausten pituuksiin, työkaluihin, viivevaatimuksiin, muistirajoihin sekä päätösten rytmiin. 1
Paljon vastauksia tuottava agentti voi hyötyä harvasta mallista ja nopeasta ulostulogeneroinnista. Jos järjestelmä tekee vähemmän mutta monimutkaisempia arvioita, hitaampi generointi voi olla hyväksyttävä hinta tiheän mallin tuottamasta käyttäytymisestä. Kumpikaan rakenne ei ole automaattisesti paras kaikissa reunalaskennan käyttökohteissa.
NVIDIA raportoi Jetson AGX Thorilla enimmillään 6,28-kertaisen dekoodaussuorituskyvyn parannuksen BF16:een verrattuna, kun NVFP4 ja spekulatiivinen dekoodaus yhdistettiin. Paras spekulatiivisen dekoodauksen kokoonpano vaihteli mallin mukaan: Nemotron 3.5 Lightningille parhaiten toimi DSpark, kun taas Qwen3.8-27B:lle DFlash2. 1
Tulos on tärkeä, koska dekoodaus eli vastaustokenien vaiheittainen tuotto määrittää usein interaktiivisen agentin koetun nopeuden. Lukua ei silti pidä tulkita yleiseksi nopeuslupaukseksi kaikille kehotteille, malleille tai laitekokoonpanoille. Luonnosmallin laatu, hyväksyntäaste, eräkoko, kontekstin pituus ja ajonaikaiset asetukset vaikuttavat todelliseen läpimenoon. 1
Laitteella ajettava malli poistaa tarpeen tehdä jokaisesta päättelypyynnöstä matka etäkonesaliin. Fyysisissä järjestelmissä tämä voi merkitä pienempää verkkoyhteydestä aiheutuvaa viivettä, toimintakykyä katkonaisilla yhteyksillä ja mahdollisuutta pitää anturivirrat sekä toimintalokit laitteella. NVIDIA korostaa reunalla tehtävän päättelyn ja agenttitekoälyn arvoa tilanteissa, joissa datan sijainti ja reaaliaikainen reagointi ovat olennaisia. 1
Pilvi-infrastruktuuri ei kuitenkaan katoa. Keskitettyjä järjestelmiä voidaan edelleen käyttää mallien koulutukseen, laitekannan hallintaan, laajoihin analyyseihin ja tehtäviin, jotka ylittävät laitteen muisti- tai laskentaresurssit. Muutos on siinä, ettei datakeskusyhteyden tarvitse olla jokaisen päätöksen kriittisellä polulla.
NVIDIA nostaa esiin matkustamon avustajat, reaaliaikaisen poikkeamien tunnistuksen sekä vaativissa tai syrjäisissä oloissa toimivat robotit. 1
Yhteinen vaatimus näille käyttötapauksille on selvä: järjestelmän on tulkittava paikallista tilannetta ja reagoitava riittävän nopeasti, jotta vastauksesta on käytännön hyötyä. Mahdollisia käyttökohteita ovat esimerkiksi:
Parhaita kohteita eivät ole vain laitteet, joissa kielimalli voidaan teknisesti ajaa. Olennaisia ovat käyttötapaukset, joissa vasteaika, tietojen paikallisuus tai toimintavarmuus ilman jatkuvaa yhteyttä tuottavat suoraa toiminnallista arvoa.
Jetson AGX Thor on NVIDIAn suorituskykyisin alusta vaativiin fyysisen tekoälyn työkuormiin. NVIDIAn mukaan siinä yhdistyvät Blackwell-grafiikkasuoritin, 128 Gt muistia ja enintään 2 070 FP4 TFLOPSin suorituskyky 130 watin tehorajassa. 3
Laitteisto sopii oppaan painotuksiin: NVFP4:ään, suureen dekoodaussuorituskykyyn ja isompien päättelymallien paikalliseen ajoon. AGX Orin on edelleen merkityksellinen vakiintuneissa sulautetuissa toteutuksissa, kun taas Thor tähtää vaativampiin generatiivisiin ja monimuotoisiin työkuormiin.
Aloitustasolle NVIDIA on ilmoittanut Jetson Orin Nano 2:n, joka on suunnattu robotiikkaan, toimitus- ja tarkastusdrooneihin sekä konenäköä hyödyntäviin järjestelmiin. NVIDIAn mukaan moduulin ja kehityspaketin odotetaan tulevan saataville vuoden 2027 ensimmäisellä puoliskolla. 1
Kokonaisuus viittaa porrastettuun valikoimaan: pienemmät järjestelmät aloitustason reunatekoälyyn, AGX Orin kypsiin sulautettuihin toteutuksiin ja AGX Thor käyttökohteisiin, joissa paikallinen generatiivinen päättely tarvitsee enemmän muistia ja laskentatehoa.
NVIDIAn opas ei väitä, että kaikkia huippumalleja voisi nyt ajaa vaivatta jokaisella sulautetulla moduulilla. Sen hyödyllisempi johtopäätös on rajatumpi: kompaktit päättelymallit, vLLM-palvelu, NVFP4-kvantisointi ja spekulatiivinen dekoodaus voivat tehdä kyvykkäistä paikallisista agenteista toteuttamiskelpoisia Jetson-luokan laitteilla. 1
Kehittäjän seuraava askel on käytännön mittaus. Kohdemalli on testattava juuri sillä Jetson-laitteella, niillä kehotteilla, työkaluilla, konteksti-ikkunoilla ja vasteaikavaatimuksilla, joita tuotteessa oikeasti käytetään. 6,28-kertainen tulos näyttää optimoinnin potentiaalin; sovelluskohtainen vertailu ratkaisee, muuttuuko se toimivaksi reunatekoälyjärjestelmäksi. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA nostaa Jetson AGX Orinin ja AGX Thorin vaihtoehdoiksi Nemotron 3.5 Lightningin ja Qwen3.8 27B:n paikalliseen ajoon.
NVIDIA nostaa Jetson AGX Orinin ja AGX Thorin vaihtoehdoiksi Nemotron 3.5 Lightningin ja Qwen3.8 27B:n paikalliseen ajoon. Nemotron 3.5 Lightning on 30 miljardin parametrin MoE malli, josta aktivoituu 3 miljardia parametria tokenia kohti.
Paikallinen päättely vähentää verkkoyhteyden merkitystä esimerkiksi roboteissa, ajoneuvoissa ja teollisuusjärjestelmissä, mutta lopullinen valinta on tehtävä oman työkuorman mittauksilla.