Nemotron 3.5 Lightning
NVIDIA
Son güncelleme: 31 Ağustos 2026
🖥️ Bu model bilgisayarında çalışır mı?
Q4 quantization ile en az 32 GB VRAM ya da birleşik bellek ister.
RTX 5090 ile doğrulandı; asıl hedefi H100/DGX Spark
NVFP4 checkpoint ile tek H100 ya da DGX Spark; RTX 5090 üzerinde de çalışıyor
Ekran kartını seç, çalışır mı gör →Bağlam uzunluğu
1M token
API giriş (1M token)
—
API çıkış (1M token)
—
Kullanıcı planı
—
Ücretsiz plan mevcut
Türkçe destek
Orta
Çok modlu
Hayır
Hızı
Hızlı
OpenAI uyumlu
Evet
SWE-Bench
51.56%
Ne İçin Kullanılır?
- ✓Ajan yürütme katmanı: tool call, sonuç doğrulama, formatlama
- ✓Yerel ve offline ajan kurulumları
- ✓Yüksek hacimli sınıflandırma ve özetleme
- ✓Kendi verinle ince ayar (LoRA / SFT)
Güçlü Yönler
- ↑Boyutuna göre çok yüksek çıktı hızı — 4 kata kadar
- ↑1 milyon token context
- ↑Ağırlık, veri ve eğitim tarifleri tamamen açık (OpenMDW-1.1)
- ↑Tek GPU veya DGX Spark üzerinde yerelde çalışıyor
- ↑OpenClaw ve Hermes Agent harness'larına göre eğitilmiş
Dikkat Edilecekler
- ↓Sınır modeli değil — karmaşık planlamada yetersiz kalıyor
- ↓Türkçe çıktı kalitesi bağımsız olarak test edilmedi
- ↓Multimodal değil, sadece metin
- ↓Hız ve doğruluk iddiaları büyük ölçüde NVIDIA'nın kendi ölçümleri
Bu Modelle İlgili Haberler
NVIDIA'nın 11 Ağustos 2026'da açık ağırlıklarla yayınladığı Nemotron 3.5 Lightning, Nemotron 3 ailesinin en küçük üyesi. 30 milyar toplam parametreli bir mixture-of-experts model ama her token için sadece 3 milyar parametre çalışıyor — yani büyük bir modelin kapasitesini küçük bir modelin işlem maliyetiyle veriyor. Tasarım amacı net: uzun süre çalışan ajanların yürütme katmanı. Bir ajanın zamanının çoğu tool call yapmak, sonuç doğrulamak, çıktı formatlamak ve alt ajanlara iş dağıtmakla geçiyor. Bu tekrarlayan trafik için sınır modeli çalıştırmak hem pahalı hem yavaş. Lightning tam bu işi üstlensin diye eğitilmiş — üstelik OpenClaw ve Hermes Agent gibi yaygın ajan harness'larına göre optimize edilmiş. Mimari Mamba-2 + MoE + attention hibriti, context uzunluğu 1 milyon token, ön eğitimde 20 trilyondan fazla token kullanılmış. NVIDIA benzer boyuttaki modellere göre 4 kata kadar yüksek çıktı hızı iddia ediyor; PinchBench'te %86 doğrulukla 10.000 görevi Qwen3.6 35B'den %30 daha hızlı bitiriyor. SWE-bench Verified skoru BF16 ağırlıklarda 51,56. Senin için asıl mesele nerede çalıştığı. NVFP4 ve BF16 checkpoint'leri var; LM Studio, llama.cpp, Ollama ve Unsloth üzerinden yerelde dönüyor, DGX Spark ile RTX 5090 üzerinde test edilmiş. OpenRouter'da ücretsiz bir endpoint'i de var, yani denemek için önce donanım almana gerek yok. Lisans OpenMDW-1.1 — sadece ağırlıklar değil, eğitim verisi ve tarifler de açık. LoRA ya da tam SFT ile kendi işine göre ince ayar yapabiliyorsun. Beklentini doğru kur: bu bir sınır modeli değil. Planlama ve karmaşık akıl yürütmeyi Nemotron 3 Ultra ya da başka bir büyük modele bırakman bekleniyor. NVIDIA'nın aynı gün açtığı NeMo Switchyard yönlendirme kütüphanesi zaten bu iş bölümünü otomatikleştirmek için çıktı: plan yukarı, yürütme aşağı.
En Yakın Alternatif
Gerekli Programlar
Açık ağırlıklı bir modeli kendi bilgisayarında çalıştırmak için bir model yöneticisi gerekir. İkisi de ücretsiz, ikisi de Windows, Mac ve Linux'ta çalışır.
LM Studio — görsel arayüz isteyenler için
Modeli listeden seçip indiriyorsun, terminal yok. Yeni başlayan için en kısa yol.
Ollama — terminalden çalıştıranlar için
Terminalden tek komutla model indirip çalıştırıyorsun, arayüz yok. Bu modelin Ollama kütüphanesinde hazır bir sürümü olup olmadığını ollama.com'da arayarak görebilirsin.
Donanım tarafı
Büyük modeller için ekran kartı yetmiyorsa, iş istasyonu sınıfı donanımın ne verdiğini rehberde ölçtük.
DGX Spark rehberi →