11 Ağustos 2026’da yayımlanan NVIDIA Nemotron 3.5 Lightning, yaklaşık 3 milyar etkin parametre kullanan açık 30B’lik bir MoE modelidir; büyük modellerin yerini almak yerine yüksek hacimli ajan görevlerini yürütmek içi... Hibrit mimarisi, NVFP4 seçeneği ve 1 milyon tokene kadar bildirilen bağlam kapasitesi düşük geci...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Nvidia’s Nemotron 3.5 Lightning, released on August 11 as a 30-billion-parameter open model for the execution layer of autonomous AI. Article summary: NVIDIA Nemotron 3.5 Lightning is best understood as a high-volume “worker” model for autonomous-agent systems: an open 30B-parameter MoE model that activates roughly 3B parameters per inference step, rather than a model . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA Nemotron 3.5 Lightning, genel amaçlı sohbet robotlarından çok otonom yapay zekâ ajanlarının yürütme katmanı için geliştirilen özel bir model. 11 Ağustos 2026’da yayımlanan model, toplam 30 milyar parametreye sahip olmasına rağmen her çıkarım adımında yaklaşık 3 milyar parametreyi etkinleştiriyor. Bu nedenle hedefi, daha büyük akıl yürütme modellerinin yerini almak değil; sürekli çalışan ajanların tekrarlayan ve yüksek hacimli işlerini hızlı biçimde gerçekleştirmek.
Bu ayrım modelin konumunu anlamak açısından kritik. Bir ajan görevin genel planını oluşturduktan sonra çoğu zaman daha küçük operasyonlar yürütür: araç çağırır, alanları çıkarır, politikaları kontrol eder, veriyi dönüştürür ve sonucu belirli bir formatta sunar. Lightning, bu yürütme katmanını daha hızlı ve ekonomik hâle getirmeyi amaçlıyor.
Lightning, sürekli çalışan ajanlarda uzmanlaşmış görevler için geliştirilen açık bir 30B Mixture-of-Experts (MoE) modelidir. NVIDIA, Nemotron ailesini ağırlıkları, eğitim verileri ve eğitim tarifleri erişilebilir modeller olarak tanımlıyor. Bu yaklaşım, geliştiricilerin modelleri üretime almadan önce incelemesine ve kendi alanlarına göre özelleştirmesine imkân veriyor.
Model BF16 ve NVFP4 formatlarında sunuluyor. NVIDIA’nın model materyallerine göre Lightning; durum uzayı veya Mamba tarzı işlemeyi, dikkat mekanizmasını ve yönlendirilmiş uzmanları bir araya getiren hibrit bir mimariye sahip. Amaç, her belirteçte ağın tamamını çalıştırmadan daha büyük bir modelin kapasitesinden yararlanmak.
“30B” ve “3B etkin” ifadeleri iki farklı şeyi anlatıyor:
Seyrek çalıştırma yaklaşımı, Lightning’in toplam kapasite bakımından daha büyük bir model sınıfında yer alırken işlem maliyeti açısından daha küçük bir etkin ağa yaklaşmasını sağlıyor. Bu, modelin tamamını depolama veya yönetme ihtiyacını ortadan kaldırmıyor; ancak üretilen her belirteç için gereken hesaplama miktarını azaltabiliyor.
Otonom ajanlar genellikle tek bir yanıt üretmekle yetinmez. İlk planın ardından defalarca araç seçimi yapabilir, yapılandırılmış veri çıkarabilir, sonuçları doğrulayabilir ve çıktıyı biçimlendirebilir.
Bu çağrıların tamamında en üst düzey bir akıl yürütme modeli kullanmak gecikmeyi ve işletim maliyetini artırabilir. Lightning’in hedefi, iş akışının öngörülebilir ve sık tekrarlanan bölümünü üstlenmek; belirsiz kararlar ve zor akıl yürütme gerektiğinde ise daha yetenekli bir modeli devreye bırakmak.
Örnek bir iki katmanlı yapı şöyle çalışabilir:
NVIDIA, 550B toplam ve 55B etkin parametreli MoE modeli Nemotron 3 Ultra’yı uzun soluklu ajanlarda üst düzey akıl yürütme ve orkestrasyon için konumlandırıyor. Bu da Lightning ile Ultra arasındaki görev paylaşımını açıkça ortaya koyuyor.
Bu model yaklaşımının verimli çalışması, isteklerin doğru modele yönlendirilmesine bağlı. Bir ajan her talebi aynı uç noktaya göndermek yerine, hangi adım için hangi modelin uygun olduğuna karar vermeli.
NVIDIA’nın NeMo Switchyard çözümü; istekleri temsil etmek, kullanılabilir model hedeflerini tanımlamak ve seçilen sağlayıcı ya da model kimliğine yapılan çağrıları yönetmek için sağlayıcıdan bağımsız bir yönlendirme SDK’sı sunuyor.
Pratikte bu, Lightning’in rutin çağrıları karşıladığı, daha büyük modelin ise daha fazla kapasite gerektiren durumlara ayrıldığı bir model hiyerarşisi kurmayı mümkün kılıyor. Bu nedenle Lightning’in en güçlü kullanım alanı bağımsız bir sohbet modeli olmak değil, birden fazla modelin yönlendirildiği ajan sisteminin parçası hâline gelmek.
Lightning, 1 milyon tokene kadar bağlam kapasitesiyle tanıtılıyor. Bu kapasite; uzun süre çalışan konuşmaları koruyan, büyük belgeleri işleyen veya kapsamlı görev durumlarıyla tekrar tekrar çalışan ajanlar için önemli olabilir. Bununla birlikte gerçek kullanılabilir bağlam ve performans, sunum altyapısına ve yapılandırmaya bağlı olacaktır.
NVFP4 kontrol noktası çıkarım amaçlı dağıtımı hedefliyor ve desteklenen NVIDIA GPU nesillerinde özel NVIDIA çekirdeklerinden yararlanıyor. NVIDIA modeli yerel altyapı, iş istasyonları, veri merkezleri ve bulut ortamları için listeliyor. Model ayrıca Hugging Face ve barındırılan hizmetler üzerinden de sunuluyor.
AWS, Nemotron 3.5 Lightning’in SageMaker JumpStart üzerinden kullanılabildiğini ve SageMaker konsolu ya da Python SDK aracılığıyla dağıtılabildiğini belirtiyor. NVIDIA’nın NIM belgeleri ise işletim sistemi, CUDA, sürücü ve Docker gereksinimleri tanımlanmış ayrı bir konteyner tabanlı dağıtım yolu sunuyor.
Donanım konusunda yine de temkinli olmak gerekiyor. Nicemlenmiş bir kontrol noktası sunumu kolaylaştırabilir; ancak tek GPU ile çalıştırılabilirlik GPU modeline, bellek ihtiyacına, bağlam uzunluğuna, nicemleme yöntemine, toplu işlem ayarlarına ve kullanılan sunum yazılımına bağlıdır. Belirli depolama tasarrufu veya geniş GeForce RTX desteği iddiaları, her dizüstü ya da masaüstü bilgisayara genellenmeden güncel model kartı ve dağıtım tarifi üzerinden doğrulanmalı.
NVIDIA ve AWS, hedeflenen ajan iş yüklerinde 4 kata kadar daha yüksek işlem hacmi ve görevlerin tamamlanmasında yüzde 30’a kadar hızlanma vadediyor. Ancak bu rakamlar model zekâsının evrensel ölçümleri veya her üretim ortamında garanti edilen sonuçlar değil.
Gerçek performans şu değişkenlere göre farklılaşabilir:
Bu yüzden Lightning’i yalnızca saniye başına belirteç üretimiyle değerlendirmek yeterli değil. Bir ajan için kritik olan işlemlerde; veri çıkarma doğruluğu, araç çağrılarının güvenilirliği, yapılandırılmış çıktı kurallarına uyum ve uçtan uca tamamlanma süresi ayrıca ölçülmelidir.
Barındırılan hizmet fiyatları, Lightning’i yüksek hacimli çıkarım için cazip kılabilir. DeepInfra, modeli 1 milyon giriş tokene 0,05 dolar ve 1 milyon çıkış tokene 0,20 dolar fiyatla listeliyor. Hizmet kullanım kadar ödeme modeliyle çalışıyor ve GPU altyapısı yönetme zorunluluğunu ortadan kaldırıyor.
Ancak bu fiyatlar modelin kalıcı ve değişmez bir özelliği değil. Farklı sağlayıcılar farklı ücretler uyguluyor; sağlayıcı, hassasiyet seviyesi, önbellekleme ve yönlendirme rotası gerçek maliyeti etkileyebiliyor. Bu nedenle Lightning’i daha büyük modellerle karşılaştıran ekipler; yeniden denemeleri, araç çağrılarını, yönlendirmeyi ve hâlâ daha yetenekli bir modele gönderilen istekleri de içeren toplam iş akışı maliyetini hesaplamalı.
Nemotron 3.5 Lightning’i en doğru şekilde, ajan sistemleri için hızlı ve özelleştirilebilir bir işçi model olarak tanımlamak mümkün. Uygulamanın çok sayıda benzer çağrı ürettiği ve görevlerin uzmanlaştırılabildiği, sınırlandırılabildiği veya sonradan eğitilebildiği durumlarda tasarımı anlamlı hâle geliyor.
Model, evrensel bir orkestrasyon modeli olarak sunulmuyor. Karmaşık planlama, belirsiz yargılar ve hata maliyetinin yüksek olduğu görevler hâlâ Nemotron 3 Ultra gibi daha büyük bir modele veya başka bir üst düzey sisteme ihtiyaç duyabilir.
Pratik sonuç şu: Lightning, yönlendirmeli çok modelli bir ajan mimarisinde düşük gecikmeli yürütme katmanı olarak en fazla değer sunuyor. 30B toplam kapasitesi, yaklaşık 3B etkin parametresi, açık model materyalleri, nicemlenmiş çıkarım seçeneği ve farklı dağıtım yolları; rutin ajan işlerini daha hızlı ve daha düşük maliyetle gerçekleştirme hedefinin parçaları. Yine de NVIDIA’nın açıkladığı kazanımlar, üretim sonucu kabul edilmeden önce kullanılacak belirli ajan iş akışı üzerinde test edilmeli.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
11 Ağustos 2026’da yayımlanan NVIDIA Nemotron 3.5 Lightning, yaklaşık 3 milyar etkin parametre kullanan açık 30B’lik bir MoE modelidir; büyük modellerin yerini almak yerine yüksek hacimli ajan görevlerini yürütmek içi...
11 Ağustos 2026’da yayımlanan NVIDIA Nemotron 3.5 Lightning, yaklaşık 3 milyar etkin parametre kullanan açık 30B’lik bir MoE modelidir; büyük modellerin yerini almak yerine yüksek hacimli ajan görevlerini yürütmek içi... Hibrit mimarisi, NVFP4 seçeneği ve 1 milyon tokene kadar bildirilen bağlam kapasitesi düşük gecikmeli dağıtımı hedefliyor; ancak performans rakamları iş yüküne ve donanıma göre değişebilir.
Önerilen mimaride büyük bir model planlama ve zor kararları üstlenirken Lightning araç çağrıları, veri çıkarma, politika kontrolleri ve çıktı biçimlendirme gibi rutin adımları yürütüyor.