Fikrini yapay zeka paraya çevirsin — ücretsiz başla →

Bilgisayarımda Hangi Yapay Zeka Çalışır?

Ekran kartını listeden seç — GB’ını bilmene gerek yok. Mac ve ekran kartsız bilgisayarlar da listede. mindilot'taki hangi açık kaynak modellerin bilgisayarında yerel çalışabileceğini, ne kadar hızlı döneceğiyle birlikte gör.

🐙 mindi diyor ki: Buradaki GB rakamları Q4 quantization baz alınarak çıkarıldı — gerçek performans kart, sürücü ve context uzunluğuna göre değişir. Sınırda çıkan bir model varsa modelin kendi sayfasındaki donanım notunu da oku.
Bunlar yerelde çalışmaz
Atria Dawn Preview — 744B parametreli MoE — tüketici donanımında çalıştırılamaz. Ölçülmüş gereksinim yok, ağırlık boyutundan çıkarım.
Inkling — 975B toplam / ~41B aktif MoE — sunucu sınıfı donanım gerekir
Nex-N2.5-Max — 1,6 trilyon parametre. Resmî kurulum önerisi her biri 16 H200 taşıyan 2 düğüm — tek kullanıcı için yerel çalıştırma pratikte mümkün değil, ağırlıklar açık olsa da bulut üzerinden kullanılır.
Hy3 — 295B MoE — sunucu sınıfı yüksek VRAM gerektiriyor
Dots 3 Note Preview — 280B toplam / 16B aktif MoE — ev makinesinde dönmez, GPU kümesi ister
K2 Horizon 375B-A23B — 375B parametre bf16'da yüzlerce GB model belleği demek; tüketici GPU'su bir yana tek sunucu bile çoğu senaryoda yetmez. Yerel denemek isteyen ailenin 7B/32B üyelerine bakmalı.
Kimi K3 — 64+ hızlandırıcılı süpernode gerekiyor
Hy4 Preview — 770B MoE — Apache-2.0 ağırlıklar açık ama vLLM/SGLang ile 8 GPU'luk düğüm gerekiyor
Ornith-1.5 397B — bf16'ta yaklaşık 800 GB — çoklu 80GB GPU düğümü şart, tüketici donanımıyla çalışmaz
MiMo-V2.6-Pro — 1 trilyondan fazla parametre — ağırlıklar açık olsa da tüketici kartıyla çalıştırılamaz, bulut GPU gerekir.
GLM-5.3 Flash — 321B MoE — MIT lisanslı ağırlıklar açık ama Q4'te bile ~180GB VRAM ister
GLM-5.2 — 753B MoE — tam model çok yüksek VRAM ister
Qwen3.8 2.4T A95B — Çoklu H100/H200 düğümü gerekiyor — tek tüketici GPU'suyla çalışmaz
MiniMax M3 — Frontier ölçekli açık ağırlık; toplam parametre açıklanmadı, tüketici donanımında pratik değil
Mistral Large 3 — 8x H100/A100 sunucu gerektiriyor — yerine Mistral Small 4 önerilir
MiMo-V2.6-Flash — 309B toplam parametre — Q4 nicelemede bile tek tüketici kartına sığmaz. Aynı gün çıkan MiMo-V2.6-Distill-Qwen-9B yerelde çalışabilir boyutta.
DeepSeek V4 Pro — FP8 quant için ~400GB VRAM gerekiyor — API kullanımı öneriliyor
Nemotron 3 Ultra — ~275GB VRAM (NVFP4) — yerelde pratik değil

VRAM seviyesine göre kısa rehber

VRAMBu seviyede açılan modeller
4-8 GBMiniCPM5-2B, Liquid LFM 2.5 2.6B, Nemotron 3 Nano, Ornith-1.5 9B, Granite 4.2 8B, Granite 4.2 3B
12-16 GBQwen3.8-27B, Granite 4.2 30B, Gemma 4 12B, Gemma 3 27B
24 GBQwen3.6-35B-A3B, Muse Glimmer, Llama 4 Scout, Ornith-1.5 35B A3B
32-48 GBNemotron 3.5 Lightning, DeepSeek V4 Flash, Llama 3.3 70B
64-96 GBNemotron 3 Super, Mistral Small 4, Mistral Medium 3.5
128 GB+Llama 4 Maverick, Qwen3 235B A22B, Kimi K2.6

Sık sorulanlar

Kaç GB VRAM ile yapay zeka modeli çalıştırabilirim?

6GB VRAM ile 3-8B parametreli küçük modeller, 16GB ile 20-30B modeller, 24GB ile 30B dense modeller rahat çalışır. 64GB üzeri VRAM veya birleşik bellek ile 70B ve üzeri modellere geçilebilir.

Ekran kartım yok, yapay zekayı işlemcide çalıştırabilir miyim?

Evet. LM Studio ve Ollama modeli tamamen sistem RAM'inde ve işlemcide çalıştırabilir. 8GB RAM ile 3B, 16GB RAM ile 8B'lik modeller açılır — ancak hız saniyede birkaç token seviyesinde kalır. Sohbetin akıcı olması için küçük modellerde kalmak gerekir.

RTX 3060 veya RTX 4060 gibi 8-12GB kartlarda hangi modeller çalışır?

8GB VRAM'li RTX 4060 / 3060 Ti sınıfı kartlarda Granite 4.2 3B ve 8B, Nemotron 3 Nano ve Liquid LFM 2.5 gibi küçük modeller rahat döner. 12GB'lık RTX 3060 12GB veya RTX 4070 ile aynı modeller daha uzun bağlamla çalışır; 12-16GB sınıfı modeller için 16GB'a çıkmak gerekir.

VRAM yetmezse RAM kullanılabilir mi?

Evet, LM Studio ve Ollama gibi araçlar yetmeyen kısmı sistem RAM'ine "offload" edebilir, ancak bu ciddi hız kaybına yol açar. Apple Silicon Mac'lerde birleşik bellek (VRAM+RAM tek havuz) olduğu için bu sorun daha az yaşanır.

Quantization (Q4) nedir, neden önemli?

Quantization, modelin ağırlıklarını daha az bit ile depolayarak boyutunu küçültme yöntemidir. Q4_K_M en yaygın dengedir — boyutu yaklaşık %70 küçültürken kalite kaybı sınırlı kalır. Bu sayfadaki GB rakamları Q4 quantization baz alınarak hesaplanmıştır.

Hangi yapay zeka modelleri tamamen ücretsiz ve yerel çalışır?

Açık ağırlıklı (open-weight) modeller — Llama, Gemma, DeepSeek, Qwen, Granite gibi — indirilip internet olmadan yerel çalıştırılabilir. Kapalı kaynak modeller (GPT, Claude, Gemini) sadece API üzerinden kullanılabilir, yerel çalıştırılamaz.

← Ana SayfaTüm ModellerLM Studio RehberiRehberler