LLM·3 dk okuma·

Dokuz Kodlama Ajanı Çatısı Dizüstü Bilgisayarınıza Karşı

Paylaş
LLMEdumints Blog

Bulut API'leri yerine yerel modelleri kodlama çatılarına (coding harness) bağlamayı denediyseniz, muhtemelen hayal kırıklığı yaşamışsınızdır. llama-bench çıktılarında gördüğünüz yüksek token/saniye hızları, gerçek bir geliştirici deneyimini (DX) yansıtmaz. Dakikalarca ekrana bakıp "Bu prefill işlemi neden tüm zamanımı alıyor?" diye düşünebilirsiniz. Sorun sizde veya donanımınızda değil; popüler kodlama çatıları yerel modeller yerine devasa veri merkezi GPU'ları varsayılarak tasarlanmıştır.

Dizüstü Bilgisayar Fiziği

Mevcut kodlama çatıları, yerel donanımların sınırlarını üç temel noktada zorlar:

  • Büyük sistem istemleri ve araç şemaları (Tool Schemas): Dizüstü bilgisayarınızın saniyede 90 token okuduğunu (prefill) ve 10 token ürettiğini (generation) varsayalım. Her 1.000 token'lık okuma, modelin yazmaya başlamasından önce ekrana yaklaşık 11 saniye bekleme süresi olarak yansır. LLM herhangi bir işlem yapmadan önce sistem istemini ve yüklü araç şemalarını baştan sona okur. Bu kombinasyon pi çatısında 2.008 token iken, Opencode için tam 18.046 token'a ulaşır. Veri merkezindeki güçlü GPU'larda (10.000+ token/sn prefill) bu fark 0.2 ile 1.8 saniye arasında önemsiz kalırken, dizüstü bilgisayarda 22 saniye ile 226 saniyelik (neredeyse 4 dakika) tahammül edilemez bir fark yaratır.

  • Daha dar bağlam (context) pencereleri: Sistem istemi tamamlandıktan sonra iş yapmak için geriye sınırlı bir bellek bütçesi kalır. İyi bir dizüstü bilgisayarda 32.000 token makul bir tahmindir. pi çatısı bu bütçenin %94'ünü asıl kodlama görevine ayırırken; Opencode, 18.046 token'ı baştan harcayarak asıl iş için bağlamın yalnızca %44'ünü bırakır.

  • Yan istek yapma alışkanlığı (Side Requests): İstemci-sunucu mimarisinde çatılar arka planda oturum başlığı veya özet çıkarma gibi yan istekleri serbestçe çalıştırabilir. Ancak yerel ortamda dizüstü bilgisayarınız hem istemci hem de sunucudur. Bu yan istekler yerel modeli kuyrukta bekletir ve tekrarlayan uzun prefill süreçlerini tetikler. 24 görev boyunca Opencode 33, crush 51 yan istek üretmiş; tek bir GPU üzerinde eşzamanlı iki işlem yürütülmeye çalışıldığı için GPU meşguliyeti %125'e kadar taşmıştır.

Deney Sonuçları ve Geliştirici Çıkarımları

Yazar, M4 MacBook Pro (24GB RAM, macOS 26.6.2) üzerinde llama.cpp ile servis edilen 3-bit kuantize Qwen 3.8 27B modelini kullanarak 9 çatıyı 8 Exercism görevinde test etmiştir.

Yazılım Geliştiriciler İçin Pratik Öğrenimler:

  • Yalın Araç Şemaları: Yerel ajan mimarisi kurarken araç tanımlarını (tool definitions) asgari seviyede tutun; her fazladan parametre prefill gecikmesini doğrudan katlar.
  • Yan İstekleri Kısıtlama: Yerel LLM kullanımında arka planda çalışan özetleme veya başlık üretme çağrılarını kapatarak donanımın tek bir göreve odaklanmasını sağlayın.
  • Hafif Çatı Seçimi: Sınırlı bağlam penceresini korumak için sistem prompt'u minimal olan ajan çerçevelerini tercih edin.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →