---
title: "macOS Üzerinde Yerel Kodlama Asistanı (Coding Agent) Nasıl Kurulur?"
url: https://blog.edumints.com/macos-uzerinde-yerel-kodlama-asistani-coding-agent-nasil-kur-7zvpb48l
category: "LLM"
date: 2026-06-13T09:06:11.959Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://ikyle.me/blog/2026/how-to-setup-a-local-coding-agent-on-macos
---

# macOS Üzerinde Yerel Kodlama Asistanı (Coding Agent) Nasıl Kurulur?

## Giriş ve Hedefler
İnternet kesintilerinde bile çalışabilen, macOS üzerinde hızlı ve OpenAI uyumlu çalışan yerel bir kodlama asistanı (coding agent) kurulumu, modern yazılım geliştiriciler için harika bir bağımsızlık ve verimlilik adımıdır. Bu rehberde, Gemma 4 (26B) modelini ve `llama.cpp` altyapısını kullanarak M1 Max çipli bir Mac üzerinde nasıl yüksek performanslı ve çevrimdışı bir asistan kuracağımızı adım adım inceleyeceğiz.

## 1. Model Seçimi ve Özellikleri
Öğrenme sürecinde yerel model çalıştırmak, API maliyetlerini sıfırlamak için harika bir yoldur. Projede, Unsloth ekibinin paylaştığı **Gemma 4 26B-A4B-it** modelinin GGUF formatı tercih edilmiştir. Yaklaşık 16 GB boyutundaki bu ana model, speculative decoding (spekülatif kod çözme) için 1 GB'lık MTP draft modeliyle entegre edilmiştir.

## 2. Temel Performans: llama.cpp + Metal
Model, Metal donanım hızlandırma aktif edilerek `llama.cpp` ile doğrudan çalıştırıldığında saniyede 58.2 token (tok/s) üretim hızına ulaşmaktadır. Bu hız temel kodlama görevleri için yeterli olsa da, asistanın arka arkaya yapacağı çoklu araç çağrılarında (tool calls) gecikmeleri önlemek adına optimize edilmelidir.

## 3. MTP Draft Modelinin Eklenmesi
Gemma 4'ün **Multi-Token Prediction (MTP)** özelliğini aktifleştirmek için llama.cpp'ye bir draft model eklenmiştir. MTP, gelecekteki token'ları tahmin ederek hız artışı sağlar. Bu sayede prompt işleme hızı değişmeden token üretim hızı **%24 artarak 72.2 tok/s** seviyesine ulaşmıştır.

## 4. MTP Parametre Optimizasyonu
MTP performansını donanıma göre ayarlamak önemlidir. Testlerde `--spec-draft-n-max` parametresi 1 ile 6 arasında denenmiş ve M1 Max çipi üzerinde en yüksek verimin **3 draft token** seçildiğinde elde edildiği gözlemlenmiştir.

## 5. MLX Karşılaştırması
Mac için yerel olarak optimize edilmiş MLX kütüphanesi (`mlx-lm`) ile yapılan testlerde şaşırtıcı bir sonuç elde edilmiştir: llama.cpp'nin MTP desteğiyle, MLX-LM'e kıyasla çok daha hızlı çalıştığı (72.2 tok/s vs 45.8 tok/s) görülmüştür. Bu durum cross-platform araçların da macOS üzerinde ne kadar optimize olabileceğini gösterir.

## 6. Görsel Desteğinin Eklenmesi
Geliştirdiğiniz web sitelerinin veya arayüzlerin ekran görüntülerini asistana analiz ettirebilmek için yerel llama.cpp sunucusuna multimodal projektör (`mmproj-BF16.gguf`) eklenmiştir. Bu entegrasyon metin üretim hızını yavaşlatmadan görsel analiz yeteneği sunar.

## 7. llama.cpp Kurulumu
macOS üzerinde Metal desteğiyle `llama.cpp` derlemek için terminalden şu komutlar koşturulur:
- `brew install cmake git tmux python@3.11`
- Depo yerel bilgisayara klonlanır ve `GGML_METAL=ON` flag'i ile derleme yapılır.

## 8. Model Dosyalarının İndirilmesi
Python sanal ortamı oluşturulduktan sonra `huggingface-cli` aracı yardımıyla ana model, MTP draft modeli ve multimodal projektör dosyaları Hugging Face depolarından yerel dizine indirilir.

## 9. Yerel Sunucunun Başlatılması
Sunucu, draft model ve multimodal projektör yolları girilerek `llama-server` komutuyla 8080 portunda ayağa kaldırılır. Bu sunucu, OpenAI uyumlu `/v1` uç noktası sağlayarak diğer popüler geliştirici araçlarıyla da entegre olabilir.

## 10. Pi Yapılandırması
Terminal tabanlı kodlama asistanı olan **Pi**, `~/.pi/agent/models.json` dosyasında yerel sunucuyu (`baseUrl`) hedefleyecek ve görsel desteğini (`"input": ["text", "image"]`) tanıyacak şekilde yapılandırılır.

## 11. Sonuç ve Pratik Çıkarımlar
Yazılım geliştiriciler ve öğrenciler için bu kurulumun pratik çıkarımı; artık bulut servislerine bağımlı kalmadan, tamamen çevrimdışı, güvenli ve ücretsiz bir yapay zeka asistanıyla kod yazmanın mümkün olmasıdır. Performans odaklı projeler için daha yavaş (55 tok/s) çalışan ancak kodlamada daha yetenekli olan Qwen 3.6 (35B) modeli de benzer adımlarla kurulabilir.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://ikyle.me/blog/2026/how-to-setup-a-local-coding-agent-on-macos)](https://ikyle.me/blog/2026/how-to-setup-a-local-coding-agent-on-macos)

---

**Kaynak:** [Hacker News](https://ikyle.me/blog/2026/how-to-setup-a-local-coding-agent-on-macos)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/macos-uzerinde-yerel-kodlama-asistani-coding-agent-nasil-kur-7zvpb48l
