Nvidia’nın yeni Nemotron 3.5 Lightning modeli, OpenAI’ın gpt-oss-120b modeliyle zeka kıyaslamalarında aynı seviyeye ulaşırken bunu dörtte biri kadar parametreyle yapan kompakt bir açık ağırlık model. Aynı zamanda kendi sınıfındaki en yüksek çıkarım hızını sunuyor.
Nvidia, yeni Nemotron 3.5 serisinin ilk modeli olan Nemotron 3.5 Lightning’i kullanıma sundu. Doğrudan Nemotron 3 Nano 30B A3B’nin ardılı olan model, toplam 31,6 milyar parametreye ve herhangi bir anda yalnızca 3,6 milyar aktif parametreye sahip hibrit Mamba-Transformer mimarisini koruyor.

Bağımsız test platformu Artificial Analysis’e göre model, Intelligence Index’te 24 puan alarak önceki modeline (15) kıyasla dokuz puanlık bir sıçrama kaydediyor. Bu performans Lightning’i, OpenAI’ın gpt-oss-120b (24) modeliyle aynı seviyeye getirirken yaklaşık dört kat daha büyük olan Nvidia’nın kendi Nemotron 3 Super (26) modelinin hemen arkasına yerleştiriyor. Aynı boyut sınıfındaki en akıllı küçük modellerden Qwen3.6 35B A3B (32) ve Meta’nın yeni Muse Glimmer (35) modeli ise net liderliğini koruyor.
Nvidia, Lightning ile verimlilik sınırında farklı bir noktayı hedefliyor. Nihai NVFP4 ağırlıklarıyla yapılan çıkış öncesi testlerde model, saniyede yaklaşık 670 token hızına ulaşıyor. Bu değer, karşılaştırılan tüm modeller arasındaki en yüksek veri işleme hızı olup Google’ın Gemini 3.5 Flash-Lite (386 token/sn) modelinden neredeyse iki kat daha hızlı bir performans anlamına geliyor. Intelligence Index’te bir görevin tamamlanması yaklaşık 0,5 dakika sürerken, Qwen3.6 35B A3B yaklaşık 3,5 dakikaya, Gemma 4 31B ise yaklaşık 5,8 dakikaya ihtiyaç duyuyor.

Buna rağmen kapalı modeller genel verimlilik sınırında hâlâ üstün durumda. Gemini 3.5 Flash-Lite, görev başına benzer bir süreyle Intelligence Index’te 37 puan alırken GPT-5.6 Luna (max) iki dakikadan kısa sürede 52 puana ulaşıyor.
Ajan Performans Testleri En Büyük Artışı Gösteriyor
Artificial Analysis’e göre en büyük gelişmeler ajan (agentic) performans testlerinde görülüyor. GDPval-AA v2 testinde Lightning, Nemotron 3 Nano’ya kıyasla 334 puanlık bir artışla 824 Elo derecesine ulaşıyor. Bu sonuç hem gpt-oss-120b (800) hem de daha büyük olan Nemotron 3 Super (698) modellerini geride bırakıyor. Terminal-Bench v2.1 testinde ise puan %7’den %24,3’e yükselerek gpt-oss-120b’nin %26,2’lik skoruna neredeyse yaklaşıyor.

Nvidia, modeli esnek OpenMDW-1.1 lisansıyla sunarak ajan tabanlı sistemler için yüksek verimli bir iş gücü olarak konumlandırıyor. Artificial Analysis, Nvidia’nın belirli alanlardaki performansı artırmak amacıyla eğitim sonrası aşamada CodeRabbit ve Harvey gibi ortaklarla çalıştığını bildiriyor.
Erişim ve Kullanılabilirlik
Nvidia modeli hem BF16 hem de NVFP4 ağırlıklarıyla sunuyor. Artificial Analysis’e göre NVFP4 sürümü de Intelligence Index’te 24 puan alıyor ve daha yüksek hassasiyetli sürüme kıyasla kalite kaybı oldukça sınırlı kalıyor. Muhakeme modeli yalnızca metinle çalışıyor ve bir milyon tokenlık bağlam penceresini destekliyor. Model ağırlıkları şu anda erişilebilir durumda. Sunucusuz çıkarım hizmeti ise DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius ve Crusoe dahil olmak üzere başka sağlayıcılar tarafından da sunuluyor.
Nvidia’nın boyut yerine verimliliğe odaklanma hamlesi yeni değil. Şirket araştırmacıları geçen yıl çokça tartışılan bir makalede, 10 milyardan az parametreye sahip modellerin çoğu ajan iş yükünü 70 ile 175 milyar parametreli modeller kadar iyi yönetebildiğini ve maliyeti on ile otuz kat düşürdüğünü savundu. Nemotron 3.5 Lightning, 31,6 milyar parametreye sahip olsa da adım başına yalnızca 3,6 milyar parametreyi aktif hâle getirerek aynı hafif sınıfta yer alıyor. Saniyede yaklaşık 670 token hızıyla ajan performans testlerinde gpt-oss-120b ve daha büyük olan Nemotron 3 Super modellerini geride bırakması, söz konusu tezin ürün seviyesindeki en net kanıtı.
Kaynak: https://the-decoder.com/nvidias-open-weight-nemotron-3-5-lightning-prioritizes-speed-over-maximum-intelligence/
