Angka “30B” dan “3B aktif” merujuk kepada dua perkara berbeza:
Pelaksanaan jarang seperti ini membolehkan Lightning berada dalam kelas model yang lebih besar, sambil menyasarkan profil inferens rangkaian aktif yang jauh lebih kecil. Ia tidak menghapuskan keperluan untuk menyimpan atau mengurus keseluruhan model, tetapi boleh mengurangkan pengiraan bagi setiap token yang dijana.
Agen autonomi biasanya menghasilkan banyak panggilan model. Satu tugasan peringkat tinggi boleh melibatkan pemilihan alat berulang kali, pengekstrakan berstruktur, pengesahan dan pemformatan jawapan selepas pelan awal disediakan.
Jika model berskala besar digunakan untuk setiap panggilan, kependaman dan kos operasi boleh meningkat. Lightning pula dimaksudkan untuk mengambil alih bahagian aliran kerja yang boleh dijangka dan kerap berlaku, sementara model yang lebih berkeupayaan kekal tersedia untuk keputusan yang kabur atau penaakulan yang sukar.
Contoh seni bina dua peringkat adalah seperti berikut:
NVIDIA meletakkan Nemotron 3 Ultra—model MoE dengan 550B parameter keseluruhan dan 55B parameter aktif—sebagai model untuk penaakulan tahap hadapan serta orkestrasi. Perbandingan ini menjelaskan peranan yang berbeza antara Ultra dan Lightning.
Nilai praktikal Lightning sebahagiannya bergantung pada sistem routing. Agen memerlukan cara untuk menentukan model yang patut mengendalikan setiap langkah, bukannya menghantar semua permintaan ke satu titik akhir yang sama.
NeMo Switchyard NVIDIA menyediakan SDK routing yang bebas daripada penyedia tertentu. Ia boleh mewakili permintaan, menentukan sasaran model dan mengurus panggilan kepada penyedia atau ID model yang dipilih. Secara praktik, ini membolehkan pembangun membina hierarki model: Lightning mengendalikan panggilan rutin, manakala model lebih besar menerima kes yang memerlukan keupayaan tambahan.
Jadi, Lightning bukan paling berguna sebagai model chatbot yang berdiri sendiri. Kedudukan produknya yang lebih kuat ialah sebagai satu komponen dalam sistem agen berbilang model yang menggunakan routing.
Lightning diiklankan dengan kapasiti konteks sehingga 1 juta token. Ciri ini relevan untuk agen yang mengekalkan perbualan panjang, memproses dokumen besar atau berulang kali bekerja dengan keadaan tugasan yang banyak. Konteks yang benar-benar boleh digunakan serta prestasi sebenar tetap bergantung pada susunan pelayan dan konfigurasi.
Checkpoint NVFP4 pula bertujuan untuk penggunaan inferens dan menggunakan kernel NVIDIA khusus merentasi generasi GPU NVIDIA yang disokong. NVIDIA menyenaraikan model ini untuk infrastruktur tempatan, stesen kerja, pusat data dan persekitaran awan. Ia juga tersedia melalui Hugging Face serta perkhidmatan yang dihoskan.
AWS menyatakan bahawa Nemotron 3.5 Lightning tersedia melalui SageMaker JumpStart dan boleh digunakan melalui konsol SageMaker atau SDK Python. Dokumentasi NIM NVIDIA menyediakan laluan penggunaan berasingan berasaskan kontena, dengan keperluan khusus untuk sistem operasi, CUDA, pemacu dan Docker.
Namun, dakwaan berkaitan perkakasan perlu dibaca dengan berhati-hati. Checkpoint terkuantisasi boleh menjadikan penyajian model lebih praktikal, tetapi kebolehlaksanaan pada satu GPU bergantung pada jenis GPU, keperluan memori, panjang konteks, kaedah kuantisasi, saiz kelompok dan perisian penyajian. Dakwaan tentang pengurangan storan atau sokongan luas untuk GPU GeForce RTX wajar disemak berdasarkan kad model dan resipi penggunaan semasa, bukan dianggap terpakai pada semua komputer riba atau komputer meja.
NVIDIA dan AWS mengiklankan sehingga empat kali ganda throughput serta penyelesaian tugasan sehingga 30% lebih pantas untuk beban kerja agen tertentu. Angka ini bukan ukuran sejagat bagi tahap kecerdasan model dan tidak menjamin prestasi produksi yang sama.
Keputusan sebenar boleh berubah mengikut:
Oleh itu, Lightning patut dinilai berdasarkan operasi yang benar-benar penting kepada agen tertentu—misalnya ketepatan pengekstrakan, kebolehpercayaan panggilan alat, pematuhan kepada output berstruktur dan masa penyelesaian hujung ke hujung—bukan hanya berdasarkan dakwaan token sesaat.
Harga yang dihoskan boleh menjadikan Lightning menarik untuk inferens berjumlah tinggi. DeepInfra menyenaraikan model ini pada harga AS$0.05 bagi setiap 1 juta token input dan AS$0.20 bagi setiap 1 juta token output, dengan penyajian berdasarkan penggunaan tanpa perlu mengurus infrastruktur GPU sendiri.
Kadar tersebut bukan ciri kekal model. Penyedia lain menyenaraikan harga berbeza, manakala penyedia, ketepatan model, caching dan laluan routing boleh mempengaruhi kos sebenar. Pasukan yang membandingkan Lightning dengan model lebih besar patut mengira kos keseluruhan aliran kerja, termasuk percubaan semula, panggilan alat, routing dan permintaan yang masih perlu dihantar kepada model lebih berkeupayaan.
Nemotron 3.5 Lightning paling tepat dilihat sebagai model pekerja yang pantas dan boleh disesuaikan untuk sistem agen. Reka bentuknya masuk akal apabila aplikasi menghasilkan banyak panggilan yang serupa dan tugasan itu boleh dikhususkan, dihadkan atau dipertingkatkan melalui post-training.
Ia tidak dipersembahkan sebagai pengganti sejagat kepada model orkestrasi berskala besar. Perancangan kompleks, pertimbangan yang tidak pasti dan tugasan yang mempunyai kos kesilapan tinggi mungkin masih memerlukan model lebih besar seperti Nemotron 3 Ultra atau sistem frontier yang lain.
Kesimpulan praktikalnya mudah: Lightning paling sesuai sebagai lapisan pelaksanaan berkependaman rendah dalam timbunan agen yang menggunakan routing. Kapasiti keseluruhan 30B, kira-kira 3B parameter aktif, bahan model terbuka, pilihan inferens terkuantisasi dan pelbagai laluan penggunaan semuanya menyasarkan kerja agen rutin yang lebih murah serta pantas. Peningkatan yang diiklankan memang menjanjikan, tetapi prestasinya perlu disahkan menggunakan aliran kerja agen sebenar sebelum dianggap sebagai keputusan produksi.