macOS Üzerinde Yerel Kodlama Asistanı (Coding Agent) Nasıl Kurulur?
İçindekiler
Giriş ve Hedefler
İnternet kesintilerinde bile çalışabilen, macOS üzerinde hızlı ve OpenAI uyumlu çalışan yerel bir kodlama asistanı (coding agent) kurulumu, modern yazılım geliştiriciler için harika bir bağımsızlık ve verimlilik adımıdır. Bu rehberde, Gemma 4 (26B) modelini ve llama.cpp altyapısını kullanarak M1 Max çipli bir Mac üzerinde nasıl yüksek performanslı ve çevrimdışı bir asistan kuracağımızı adım adım inceleyeceğiz.
1. Model Seçimi ve Özellikleri
Öğrenme sürecinde yerel model çalıştırmak, API maliyetlerini sıfırlamak için harika bir yoldur. Projede, Unsloth ekibinin paylaştığı Gemma 4 26B-A4B-it modelinin GGUF formatı tercih edilmiştir. Yaklaşık 16 GB boyutundaki bu ana model, speculative decoding (spekülatif kod çözme) için 1 GB'lık MTP draft modeliyle entegre edilmiştir.
2. Temel Performans: llama.cpp + Metal
Model, Metal donanım hızlandırma aktif edilerek llama.cpp ile doğrudan çalıştırıldığında saniyede 58.2 token (tok/s) üretim hızına ulaşmaktadır. Bu hız temel kodlama görevleri için yeterli olsa da, asistanın arka arkaya yapacağı çoklu araç çağrılarında (tool calls) gecikmeleri önlemek adına optimize edilmelidir.
3. MTP Draft Modelinin Eklenmesi
Gemma 4'ün Multi-Token Prediction (MTP) özelliğini aktifleştirmek için llama.cpp'ye bir draft model eklenmiştir. MTP, gelecekteki token'ları tahmin ederek hız artışı sağlar. Bu sayede prompt işleme hızı değişmeden token üretim hızı %24 artarak 72.2 tok/s seviyesine ulaşmıştır.
4. MTP Parametre Optimizasyonu
MTP performansını donanıma göre ayarlamak önemlidir. Testlerde --spec-draft-n-max parametresi 1 ile 6 arasında denenmiş ve M1 Max çipi üzerinde en yüksek verimin 3 draft token seçildiğinde elde edildiği gözlemlenmiştir.
5. MLX Karşılaştırması
Mac için yerel olarak optimize edilmiş MLX kütüphanesi (mlx-lm) ile yapılan testlerde şaşırtıcı bir sonuç elde edilmiştir: llama.cpp'nin MTP desteğiyle, MLX-LM'e kıyasla çok daha hızlı çalıştığı (72.2 tok/s vs 45.8 tok/s) görülmüştür. Bu durum cross-platform araçların da macOS üzerinde ne kadar optimize olabileceğini gösterir.
6. Görsel Desteğinin Eklenmesi
Geliştirdiğiniz web sitelerinin veya arayüzlerin ekran görüntülerini asistana analiz ettirebilmek için yerel llama.cpp sunucusuna multimodal projektör (mmproj-BF16.gguf) eklenmiştir. Bu entegrasyon metin üretim hızını yavaşlatmadan görsel analiz yeteneği sunar.
7. llama.cpp Kurulumu
macOS üzerinde Metal desteğiyle llama.cpp derlemek için terminalden şu komutlar koşturulur:
brew install cmake git tmux [email protected]- Depo yerel bilgisayara klonlanır ve
GGML_METAL=ONflag'i ile derleme yapılır.
8. Model Dosyalarının İndirilmesi
Python sanal ortamı oluşturulduktan sonra huggingface-cli aracı yardımıyla ana model, MTP draft modeli ve multimodal projektör dosyaları Hugging Face depolarından yerel dizine indirilir.
9. Yerel Sunucunun Başlatılması
Sunucu, draft model ve multimodal projektör yolları girilerek llama-server komutuyla 8080 portunda ayağa kaldırılır. Bu sunucu, OpenAI uyumlu /v1 uç noktası sağlayarak diğer popüler geliştirici araçlarıyla da entegre olabilir.
10. Pi Yapılandırması
Terminal tabanlı kodlama asistanı olan Pi, ~/.pi/agent/models.json dosyasında yerel sunucuyu (baseUrl) hedefleyecek ve görsel desteğini ("input": ["text", "image"]) tanıyacak şekilde yapılandırılır.
11. Sonuç ve Pratik Çıkarımlar
Yazılım geliştiriciler ve öğrenciler için bu kurulumun pratik çıkarımı; artık bulut servislerine bağımlı kalmadan, tamamen çevrimdışı, güvenli ve ücretsiz bir yapay zeka asistanıyla kod yazmanın mümkün olmasıdır. Performans odaklı projeler için daha yavaş (55 tok/s) çalışan ancak kodlamada daha yetenekli olan Qwen 3.6 (35B) modeli de benzer adımlarla kurulabilir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://ikyle.me/blog/2026/how-to-setup-a-local-coding-agent-on-macos)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →