Mac'inde AI Kodlama Asistanlarını Yerel Olarak Çalıştırma Rehberi

Mac'inde AI Kodlama Asistanlarını Yerel Olarak Çalıştırma Rehberi

Tem 09, 2026 local-ai apple-silicon llama-cpp coding-agents gemma macos machine-learning speculative-decoding

Neden Yerel Çalışmalı?

Herkesin başına gelmiştir. Kod yazarken sonunda bir akış yakaladınız, elleriniz klavyede uçuşuyor, ta ki — internet gidiyor. Bulut tabanlı yapay zeka asistanınız çöp oluyor, ekranınızdaki koda bakıp "ne yapacağım şimdi" diye düşünüyorsunuz.

İşte bana da geçenlerde böyle oldu ve bu beni tamamen yerel olarak çalışan kapasiteli bir AI kodlama ajanı kurmaya itti. Karşıma çıkan şey beni şaşırttı: doğru kurulumla Apple Silicon üzerinde beklenmedik derecede iyi performans elde edebiliyorsunuz, hatta Mac'e özel optimize edilmiş çözümleri geride bırakabiliyorsunuz.

Gerçekten İşe Yarayan Kurulum

Bolca test ve kıyaslama sonrasında, M1 Max 64GB unified memory'li cihazımda en iyi sonuçları veren yapılandırma şu oldu:

Temel Yığın:

  • Metal hızlandırmasıyla derlenmiş llama.cpp
  • GGUF formatında, Q4'e quantize edilmiş Gemma 4 26B-A4B
  • Spekulatif decoding için Multi-Token Prediction (MTP) draft modeli
  • Ekran görüntüsü desteği için Gemma 4 multimodal projector
  • Terminal tabanlı kodlama ajanı olarak Pi

Bu teoride kurabileceğiniz en güçlü sistem değil, ama gerçek kullanılabilirlik açısından altın nokta burası. Saniye başına token sayısıyla ilgileniyorsunuz, yanıt başına dakika değil.

Önemli Olan Rakamlar

Tüm konfigürasyonlarda tutarlı kıyaslamalar yapmak için şu promptu kullandım:

"Bir unified diff'i ayrıştıran ve değiştirilen dosya yollarını döndüren kompakt bir Python fonksiyonu yaz. Sonra iki edge case'i açıkla."

Her test yaklaşık 128 token üretti, böylece generation hızını adil bir şekilde karşılaştırabildim.

Temel Performans:

Gemma 4'ü doğrudan Metal destekli llama.cpp üzerinden çalıştırmak saniyede 58.2 token verdi. Bu kullanılabilir, ama gerçekçi olalım — birden fazla tool çağrısı yaptığınız ve yanıt beklediğiniz kodlama seanslarında oldukça yavaş hissettiriyor.

MTP Farkı:

İşte işlerin ilginçleştiği yer burası. Multi-Token Prediction, modelin birden fazla token'ı "speküle etmesine" olanak tanıyor — doğru tahminleri kabul ediyor, yanlış olanları geri alıyor. Q8 MTP draft modeli aktifken performans 72.2 token/saniyeye sıçradı — ana modelde hiçbir değişiklik yapmadan %24'lük bir iyileşme.

Prompt işleme hızı hemen hemen aynı kaldı (saniyede 297-299 token civarı), ama agent workflow'ları için önemli olan generation hızı. Sürekli yeni promptlar göndermiyorsunuz — modelin yanıt üretmesini, karar vermesini ve tool çalıştırmasını bekliyorsunuz.

Draft token sayılarını 1'den 6'ya kadar test ettim ve M1 Max'imde en iyi nokta 3 draft token oldu. 4'ün üzerindeki değerler işleri yavaşlatmaya başladı, ki bu mantıklı — daha fazla spekülasyon, yanlış tahminlerde daha fazla boşa giden iş demek.

llama.cpp vs. MLX: Şaşırtıcı Kazanan

Beni şaşırtan buydu: Apple Silicon için özellikle optimize edilmiş MLX'in (Apple'ın native ML framework'ü) hakim olmasını bekliyordum. Gerçeklik farklıydı.

| Çalışma Zamanı | Generation token/s | |----------------|---------------------| | llama.cpp Metal + MTP | 72.2 | | llama.cpp Metal | 58.2 | | MLX-LM (Unsloth 4-bit) | 45.8 | | MLX-LM (standard 4-bit) | 43.9 | | MLX-LM (OptiQ 4-bit) | 38.1 |

MTP'li llama.cpp, en iyi MLX konfigürasyonundan yaklaşık %58 daha hızlıydı. Llama.cpp'ye yıllardır yatırılan optimizasyon çalışmaları açıkça meyvesini vermiş — platformlar arası olmasına rağmen macOS'te mükemmel çalışıyor.

Görüntü Yeteneklerini Eklemek

Düzgün bir kodlama ajanı deneyimi için ekran görüntüleri gönderebilmek istiyorsunuz. Belki ajanın ne inşa ettiğinizi görmesini, ya da az önce yaptığınız bir UI değişikliğini incelemesini istiyorsunuz.

Problem şu: Sadece Gemma 4 12B natively multimodal. Kullandığımız 26B modelin yanında harici multimodal projector'ın yüklenmesi gerekiyor.

--mmproj projector'ını llama.cpp'ye eklediğimde, Pi'ye multimodal yetenekleri düzgünce iletti ve görüntü tool çıktıları sorunsuz akmaya başladı. Daha da önemlisi, bu herhangi bir ölçülebilir yavaşlama getirmedi — generation hızı 72.2 token/saniyede kaldı.

Gerçek Dünya Deneyimi

Bu kurulumla yaklaşık 17GB model dosyasıyla uğraşıyorsunuz (ana model için 16GB, artı MTP head ve projector). 64GB unified memory'si olan biri için bu tamamen yönetilebilir.

Ajant olarak Pi, llama.cpp'nin server modunun açığa çıkardığı OpenAI-compatible API'ye bağlanan temiz bir terminal arayüzü sunuyor. Bu, OpenAI API formatını destekleyen herhangi bir tool ile kullanabileceğiniz anlamına geliyor — lock-in olmadan esneklik.

En büyük avantaj? İnternet gittiğinde — ki en kötü anda gidecek — kod yazmaya devam ediyorsunuz. Ajan bulut alternatiflerinden biraz daha yavaş olabilir, ama workflow'unuzu sürdürebilecek kadar responsive.

Başlangıç

Metal desteğiyle llama.cpp'yi derlemeniz gerekiyor. Proje macOS build'leri için iyi belgelenmiş, derleme tamamlandığında server modu o OpenAI uyumlu endpoint'i size veriyor.

Model konusunda Hugging Face'deki Unsloth GGUF quantizasyonları iyi optimize edilmiş. Ana model için Q4_K_XL quantizasyonunu ve eşleşen Q8 MTP draft modelini isteyeceksiniz.

--spec-draft-n-max değerini ayarlayın — 3'ten başlayın ve 1'den 6'ya kadar test ederek kendi donanımınızda en iyi noktayı bulun. Farklı Apple Silicon konfigürasyonları farklı sweet spot'lara sahip olabilir.

Buna Değer mi?

Düzenli olarak AI asistanlarıyla kod yazıyor ve donanıma sahipseniz (minimum 16GB, 32GB+ önerilir), kesinlikle değer. İnternet bağlantısından bağımsızlık bile tek başına değerli, üstelik MTP generation hızlarını gerçekten kullanılabilir bir seviyeye getirdiğinde, deneyim şaşırtıcı derecede olgunlaşmış oluyor.

Bu açık modellerle GPT-4 sınıfı zekaya ulaşamayacaksınız, ama kod tamamlama, refactoring, debugging yardımı ve genel kodlama ajanı görevleri için? Beklediğinizden çok daha yetenekli. Üstelik size ait — yerel olarak çalışıyor, gizlilik tamamen sizde, latency spike'ları veya servis kesintileri yok.

Araçlar önemli ölçüde olgunlaştı. Daha önce yerel modellerle denediniz ve hız sizi hayal kırıklığına uğrattıysa, bu kuruluma bir şans verin. MTP denklemi ciddi şekilde değiştiriyor.

Read in other languages:

RU BG EL CS UZ SV FI RO PT PL NB NL HU IT FR ES DE DA ZH-HANS EN