*Yukarıdaki butona tıkla ve ekle. Yapay zeka gelişmelerini Google’da her zaman üstte gör.

NVIDIA Nemotron 3 ailesi — Nano, Super, Ultra ve Nano Omni. Hangi model hangi iş için, build.nvidia.com ve OpenRouter'da ücretsiz kullanım, fiyatlar ve yerelde çalıştırma için gereken gerçek VRAM.
NVIDIA, Aralık 2025'te Nano ile başlayıp Haziran 2026'da Ultra ile tamamladığı Nemotron 3 ailesiyle agentici
otonom, çok adımlı görevleri kendi başına yürüten AI tarafında iddialı bir çıkış yaptı. Üç ana model (Nano, Super, Ultra) + multimodal Nano Omni varyantı — hepsi açık ağırlıklı (open-weights), hepsi hybrid Mambai
uzun context'i verimli işleyen state-space mimarisi-Transformer MoEi
Mixture of Experts: her token için modelin sadece küçük bir uzman alt kümesi çalışır yapısında, hepsi NVIDIA'nın kendi platformu build.nvidia.com'da ücretsiz denenebiliyor. Amaçları aynı: otonom AI ajanları, çok adımlı reasoning, kod yazma ve kurumsal görevler.
Dört model de aynı temel mimariyi paylaşıyor: Hybrid Mamba-Transformer + Mixture of Experts (MoE). Geleneksel Transformer'lara Mamba state-space katmanlarını ekleyerek uzun context'lerde hem hız hem doğruluk kazanıyorlar. MoE sayesinde toplam parametrelerinin sadece küçük bir kısmı her token için aktif — bu da inferencei
modelin cevap üretme aşaması maliyetini düşürüyor.
| Özellik | Nano | Nano Omni | Super | Ultra |
|---|---|---|---|---|
| Toplam parametre | ~30B | ~30B | ~120B | ~550B |
| Aktif parametre | 3B | 3B | 12B | 55B |
| Mimari | Hybrid Mamba-Transformer MoE | Hybrid Mamba-Transformer MoE | Hybrid Mamba-Transformer MoE + MTP | Hybrid Mamba-Transformer MoE + MTP |
| Context penceresi | 256K | 256K | 1M (OR ücretsizde 262K) | 1M |
| Modalite | Metin | Metin + Görsel | Metin | Metin |
| Çıkış tarihi | Aralık 2025 | Nisan 2026 | Mart 2026 | Haziran 2026 |
| Lisans | NVIDIA Open Model License | NVIDIA Open Model License | NVIDIA Open Model License | NVIDIA Open Model License |
| Açık kaynak | ✅ (weights + dataset + recipe) | ✅ | ✅ | ✅ |
MTP (Multi-Token Prediction): Super ve Ultra'da bulunan bu özellik, modelin her adımda tek token yerine birden fazla token tahmin etmesini sağlıyor. NVIDIA'ya göre çok adımlı ajan görevlerinde belirgin bir üretim hızı kazancı veriyor.
Context penceresi rakamları modelin desteklediği maksimumu gösterir. OpenRouter gibi platformların ücretsiz katmanları çoğu zaman daha düşük bir sınır sunar (aşağıda ayrıntı var) — tam context'e güvenmeden önce kullandığın provider'ı teyit et.
Serinin ana küçük modeli. 30 milyar toplam parametrenin sadece 3 milyarı her token için aktif — bu sayede aynı boyuttaki dense modele göre çok daha hızlı çalışıyor. NVIDIA, Nemotron 2 Nano'ya göre kayda değer bir throughputi
saniyede üretilen token miktarı artışı bildiriyor.
Dikkat: "3B aktif" ifadesi hızı anlatır, bellek ihtiyacını değil. MoE modellerde bütün uzmanlar bellekte durmak zorunda, yani Nano yine de 30B'lik yer kaplar. Gerçekten düşük VRAM'li kartlar için NVIDIA ayrı bir Nano 4B sürümü yayınladı — Jetson ve 6-8 GB'lık kartlarda çalışan asıl "edge" model o (aşağıda donanım tablosuna bak).
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Nano model sayfası
Ne için ideal:
Ne için değil:
Nano'yu kendi bilgisayarında çalıştırmak istersen: LM Studio Bionic Rehberi
Nano'nun multimodal versiyonu. Metin + görsel girdi alabiliyor. Aynı 30B/3B parametre yapısını koruyor ama görsel anlama yeteneği eklenmiş. NVIDIA bunu "multimodal alt-ajan" olarak konumluyor — hafif, görsel okuyabilen ajan görevleri için.
Ne için ideal:
Serinin fiyat/performans lideri. 120 milyar parametrenin 12 milyarı aktif — Nano'dan 4 kat fazla aktif parametre. MTP ve LatentMoEi
NVIDIA'nın uzman yönlendirme yöntemi ile hızlı üretim yapıyor. Native context penceresi 1M'e kadar çıkıyor.
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Super model sayfası
Benchmark öne çıkanlar (NVIDIA'nın paylaştığı sonuçlar):
Bunlar NVIDIA'nın kendi ölçümleri — bağımsız testlerde farklılaşabilir, kendi işinde dene.
Ne için ideal:
Ne için değil:
Serinin amiral gemisi. 550 milyar parametre, 55 milyar aktif, 1 milyon token context penceresi. NVIDIA'nın "frontier-reasoning ve orchestration" olarak konumlandırdığı model; 20 trilyon token üzerinde ön-eğitilmiş, ardından context 1M'e uzatılmış. Uzun soluklu ajan işleri için tasarlanmış.
Tüm özellikler, benchmark ve mindi skoru: Nemotron 3 Ultra model sayfası
Ne için ideal:
Ne için değil:
Nemotron 3 serisinin en çarpıcı yanı: dört modeli de para vermeden deneyebiliyorsun. İki ücretsiz kapı var: NVIDIA'nın kendi platformu build.nvidia.com (dördü de var) ve OpenRouter'ın ücretsiz uç noktaları (Nano 30B A3B hariç üçü var; Nano'nun ücretsiz ucu Temmuz'dan sonra kalktı).
| Model | build.nvidia.com | OpenRouter (free) | OpenRouter (ücretli) |
|---|---|---|---|
| Nano 30B A3B | ✅ ücretsiz deneme | ❌ | $0.05 / $0.20 (M token) |
| Nano Omni | ✅ ücretsiz deneme | ✅ $0/M | ücretli uç yok |
| Super 120B A12B | ✅ ücretsiz deneme | ✅ $0/M (262K context) | $0.08 / $0.45 (M token) |
| Ultra 550B A55B | ✅ ücretsiz deneme | ✅ $0/M (1M context) | $0.60 / $2.40 (M token) |
İkisinin de bedeli var: ücretsiz katman rate limit demek, build.nvidia.com'un ücretsiz katmanı ise şartlar gereği üretimde kullanılamıyor (ayrıntı aşağıda). Üretim yükü için ücretli sağlayıcılar var.
Fiyatlar 25 Eylül 2026'da OpenRouter'dan alındı ve sık değişir. Prompt caching kullanan provider'larda uzun, tekrarlı context'lerde efektif input maliyeti liste fiyatının altına inebilir — ama gerçek oranı kendi kullanımında ölç, peşinen bir indirim varsayma.
[mindi_yorum]
💰 Dört model de build.nvidia.com'da ücretsiz denenebiliyor, OpenRouter'da üçünün $0 ucu var. Ücretli katmanda bile Ultra $0.60/$2.40 ile bu boyut için ucuz sayılır.
🟡 "Ücretsiz" = sınırsız değil. Free uçlar rate limitli, build.nvidia.com'un şartları da üretimi yasaklıyor. Ürününü free katmana yıkarsan duvara toslarsın.
🔵 Önce Super'in ücretsiz ucuyla başla; işini görüyorsa ücretli katmana geçmek zaten ucuz.
Tüm modeller OpenRouter'da: openrouter.ai/nvidia/nemotron-3-ultra-550b-a55b gibi endpoint'lerle API'den veya chat arayüzünden kullanılabiliyor. Nano 30B A3B dışındaki üçünün ücretsiz uç noktası var.
OpenRouter'ı hiç kullanmadıysan: OpenRouter Rehberi — Tek API, Tüm Modeller
OpenRouter'daki ücretsiz endpoint'i Hermes Agent'a bağlayıp kendi AI ajanını kurabilirsin. Nemotron'u agent modelin yapıp masaüstü işlerini otomatikleştirebilirsin.
Kurulum için: İşlerini Ücretsiz AI Ajanlar Halletsin: Hermes + OpenRouter
Tüm modellerin weights'leri Hugging Face'te:
vLLM, SGLang, Ollama, llama.cpp ile deploy edilebiliyor. NVIDIA GPU'su şart değil — ama performans için öneriliyor.
NVIDIA'nın kendi model kataloğu. Dört Nemotron 3 modelinin yanında yeni Nemotron 3.5 Lightning ve DeepSeek, Kimi, GLM, gpt-oss, Llama, Mistral gibi başka ailelerden onlarca model burada. Hepsini tek anahtarla, ücretsiz deneyebiliyorsun (Eylül 2026'da API listesinde 82 model var).
Kurulum üç adım:
.env dosyasında sakla.base_url ve model adı değişiyor.from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="NVIDIA_API_KEYIN",
)
response = client.chat.completions.create(
model="nvidia/nemotron-3-super-120b-a12b",
messages=[{"role": "user", "content": "Merhaba!"}],
)
print(response.choices[0].message.content)
Kredi sistemi yok; onun yerine model başına rate limiti
servisin belirli sürede kabul ettiği istek sayısı sınırı var. Limit modele ve o anki toplam trafiğe göre değişiyor, NVIDIA sabit bir rakam yayınlamıyor ve ücretsiz katmanda limit artırımı yapmıyor. Yoğun saatlerde bekleme süresi uzayabiliyor.
Asıl kritik nokta şartlar. NVIDIA'nın API deneme şartlarına göre servis yalnızca deneme amaçlı, üretimde kullanılamaz. Geliştirme, test, araştırma ve değerlendirme dışındaki her kullanım, mesela müşterine hizmet veren bir uygulama, üretim sayılıyor. Kişisel, finansal ya da sağlık verisi göndermek de şartlarla yasak. Yani build.nvidia.com prototip kurmak ve modelleri kıyaslamak için iyi bir alan; ürününü üstüne kurmak için değil. Üretime geçerken OpenRouter'ın ücretli uçlarına ya da kendi sunucuna taşı.
MoE'de aktif parametre hızı belirler, VRAM'i değil — bütün uzmanlar bellekte durur. Yani modeli boyutuna göre değil, toplam parametresine göre yerleştirmen gerekir. Aşağıdaki rakamlar Q4 quantize ağırlıkları + makul context için kabaca:
| Model | Kaba VRAM (GGUF Q4) | Gerçekçi donanım |
|---|---|---|
| Nano 4B | ~4-6 GB | RTX 4050/3060, Jetson Orin Nano 8 GB, Apple M1 |
| Nano 30B A3B | ~18-20 GB | RTX 3090/4090 (24 GB sınıfı) |
| Super 120B A12B | ~65-70 GB | Çoklu GPU / workstation (tek 4090'a sığmaz) |
| Ultra 550B A55B | ~300+ GB | 4-8× A100/H100, veri merkezi |
Yani "tüketici kartında Nemotron" istiyorsan doğru adres Nano 4B; 30B A3B için 24 GB'lık bir kart gerekir, Super ve Ultra ise pratikte çoklu GPU / bulut işi.
Yerel AI ile ilgili daha fazlası: Yapay Zekaya Ücret Ödemeden Yerel AI Rehberi
[mindi_yorum]
💰 NVIDIA'nın "hepsi açık, hepsi ücretsiz başlıyor" stratejisi topluluğu kendine çekmek için — tıpkı Meta'nın Llama'da yaptığı gibi. Fark şu: Nemotron 3 sadece weights değil, dataset ve eğitim reçetesini de açıyor.
🟢 Super 120B A12B serinin yıldızı. 12B aktif parametreyle çok daha büyük dense modellerle yarışıyor, MTP ile hızlı. "Bir tane Nemotron seç" desen, bu olur.
🟡 Context penceresi rakamlarına kağıt üstünde güvenme. Model 1M destekliyor olabilir ama kullandığın provider daha azını sunuyor olabilir — free endpoint'ler özellikle kısar. Uzun context'li bir işe girmeden önce teyit et.
🔵 Yerelde denemek isteyip elinde 6 GB kart varsa: 30B'yi değil, Nano 4B GGUF'u indir. LM Studio'da "nemotron-3-nano-4b" arat, Q4_K_M quant'ı seç, dakikalar içinde çalışır.
Nano / Nano Omni seç, eğer:
Super seç, eğer:
Ultra seç, eğer:
Bilgiler 25 Eylül 2026'da OpenRouter, Hugging Face ve NVIDIA developer sayfalarından derlendi. Fiyat, context ve benchmark verileri sık değişir — kullanmadan önce güncel durumu kontrol et.