LLM·3 dk okuma·

Yerel 4B, Güçlü Bulut Modeli ve Rol Ayrımı Karşılaştırması: Beklenmedik Sonuçlar

Paylaş
Yerel 4B, Güçlü Bulut Modeli ve Rol Ayrımı Karşılaştırması: Beklenmedik Sonuçlar

Kendi Kendini İyileştiren Ajanlar ve AgentSelfEdit

AgentSelfEdit, çalıştırma geri bildirimlerinden kendi sistem prompt'unu yeniden yazan açık kaynaklı bir yardımcı araçtır (sidecar). Yapılan düzenlemeleri A/B testine tabi tutar ve yalnızca istatistiksel olarak başarısı kanıtlanmış kazananları terfi ettirir.

Geliştirici başlangıçta standart bir sonuç bekliyordu: Küçük yerel model başarısız olur, büyük bulut modeli daha iyi çalışır, rolleri ayırmak ise sonuçları daha da iyileştirir. Ancak v0.3.0 sürümündeki saha testleri çok daha karmaşık ve öğretici sonuçlar ortaya koydu.

Üç Farklı Kurulum ve İstatistiksel Kanıt Eşiği

Aynı kendini düzenleme döngüsü üç farklı mimaride çalıştırıldı:

  • Yerel model: Qwen3-4B-Instruct-2507-4bit
  • Bulut modeli: mistralai/mistral-small-3.2-24b-instruct
  • Rol ayrımı mimarisi: Yürütücü (executor) ve analizci (analyzer) için farklı modellerin seçildiği yapı

Her denemede aynı akış izlendi: Başarısız izleri topla, analizcinin bir prompt düzenlemesi önermesini sağla, adayı mevcut prompt ile A/B testine sok ve onay kapısını (gate) çalıştır. Saha testinde terfi veri kümesinde 40 görev, ayrılmış (held-out) test setinde 25 görev yer aldı. Kapı şartı olarak $p \le 0.05$ ve minimum %5 etki boyutu zorunlu tutuldu. Modeller sübjektif hislerle değil, somut kanıtlara dayanan bir barajla değerlendirildi.

1. Yerel 4B Beklenenden Daha Durgundu

Yerel Qwen3-4B modeli beklentilerin gerisinde kaldı:

  • Başlangıç: %60.0 | Nihai: %60.0 | İterasyon: 5 | Terfi: 0
  • İterasyon dökümü: İterasyon 1, 2 ve 4'te değişim olmadı (0 iyileşme, 0 gerileme). İterasyon 3 ve 5'te ise 1 iyileşmeye karşılık 1 gerileme yaşandı.

Bu tablo, istatistiğin bir başarıyı sakladığı anlamına gelmiyordu; model çoğunlukla etkisiz düzenlemeler (null-edit) üretti. Yerel model yürütücü olarak ucuz, kararlı ve yeterli olsa da analizci rolünde sürekli aynı dar alanda tıkandı.

2. Büyük Bulut Modeli İşe Yaradı, Ama Yetersiz Kaldı

Mistral 24B bulut modeline geçildiğinde hareketlilik başladı:

  • Başlangıç: %64.0 | Raporlanan Nihai: %68.0 | İterasyon: 8 | Terfi: 0
  • %64'ten %68'e yükseliş dikkatli okunmalıdır; hiçbir prompt istatistiksel kapıyı geçip kalıcı terfi alamadı.
  • A/B testindeki en iyi iterasyonda 2 görevde iyileşme, 0 gerileme sağlandı (ortalama fark = 0.05, etki boyutu = 0.0625, $p = 0.79$).

Daha güçlü bir model optimizasyonu iyileştirdi ancak $p \le 0.05$ barajını aşarak terfi almaya yetmedi.

3. Rol Ayrımı En Tuhaf Sonuçları Verdi

v0.3.0 ile yürütücü, analizci ve hakem modellerinin birbirinden ayrıldığı çoklu model koşucusu devreye alındı.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Boyut tek başına yeterli değildir: "Büyük model kullan, sorun çözülsün" yaklaşımı her zaman geçerli değildir; model büyüse de istatistiksel anlamlılık yakalanamayabilir.
  • İstatistiksel A/B testleri kurun: Prompt optimizasyonunda rastlantısal başarıları önlemek adına p-değeri ve etki boyutu gibi katı kapı filtreleri kullanın.
  • Rolleri yeteneğe göre dağıtın: Küçük modeller rutin yürütme işlerinde maliyet avantajı sağlarken, hata analizi gibi meta-görevlerde yetersiz kalabilir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Prompt Versioning ve A/B Testi modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →