Kendi Promptunu İyileştiren Ajanımı Kurtarmak İçin 4 Model Denedim: Hepsi Başarısız Oldu

İçindekiler
İki sürüm boyunca sorunun model kabiliyetinden kaynaklandığına inandım; fakat yanılmışım. v0.1.0 sürümünde "4B modeli çok küçük, daha büyük bir model daha iyi prompt düzenlemeleri bulacaktır" dedim. v0.2.0'da ise "Mistral 24B veya 30B bu düzenlemeyi kesinlikle bulur" diye düşündüm.
Sonuç tam bir hayal kırıklığı oldu: 4 farklı model test edildi, 4.150 LLM çağrısı yapıldı, 31'i v0.1.0 ve 26'sı v0.2.0 kaynaklı 57 hata çözüldü; ancak üretime alınabilir (promotable) tek bir düzenleme dahi elde edilemedi. Sorun hiçbir zaman modelin kendisi değildi; asıl sorun arama stratejisindeydi.
"Daha Büyük Model" Teorisini Çürüten Veriler
Test edilen tüm modeller sıfır terfi ile sonuçlandı:
- Qwen3-4B-Instruct (yerel MLX): Başlangıç %60, Final %60, Üretime Uygun: Hayır. Her iterasyonda aynı düzenleme ailesini önerdi; hızlı ve ücretsizdi ancak sığ kaldı.
- Mistral Small 24B (OpenRouter): Başlangıç %64, Final %64, Üretime Uygun: Hayır. Daha derin analiz yaptı fakat zayıf bir yerel alana sıkışıp kaldı.
- Qwen 30B-A3B (OpenRouter): Başlangıç %64, Final %64, Üretime Uygun: Hayır. İyileşme sağlamadan yalnızca gecikme (latency) ekledi; Mistral'den daha zayıf bir analizci kaldı.
- Llama 3.2-1B (OpenRouter): Başlangıç %36, Final %36, Üretime Uygun: Hayır. Bir analizci olarak neredeyse hiç çalışamadı ve geçerli teklif üretemedi.
İterasyon Analizi: Gürültü ve Yönelim
- Qwen 4B (5 İterasyon): Değişimler tamamen rastlantısaldı (gürültü). Bazen hafif pozitif (+0.025), bazen negatif (-0.05) sonuçlar üretti; p-değerleri (0.46 - 1.0) istatistiksel olarak anlamsızdı.
- Mistral 24B (5 İterasyon): 5 iterasyonun 3'ünde pozitif delta (+0.025) yakalayarak gerçek bir sinyal üretti. Ancak p-değeri hiçbir zaman 0.05 eşiğini aşamadı. Bulduğu iyileştirme gerçekti, fakat kendini kanıtlayacak kadar güçlü değildi.
Karanlık Örüntü: Yerel Minimumda Sıkışıp Kalmak
Tüm modeller promptun aynı dar bölgesinde dönüp durdu:
- Fatura ayrıştırma kuralları: "Sayfada yanlış tutar göründüğünde bu teknik bir sorundur, fatura değil."
- Aciliyet kısıtı ifadeleri: "Kritik" ve "güvenlik" öncelik kurallarının yeniden ifade edilmesi.
- Çıktı formatının sıkılaştırılması: "Virgülle ayrılmış etiketler çıktısı verildiğinden emin olun."
Mistral 24B şu varyantları denedi:
- "Güvenlik ihlaline 'aktif' ifadesini ekle"
- "'Yalnızca iş sürekliliği için kritikse' ifadesini ekle"
- "'Acil müdahale gerektirir' kuralını ekle"
Bunların hepsi aynı düzenleme sınıfına aitti; farklı bir hata ailesine ya da promptun başka bir bölümüne sıçrayamadı. Model aynı kavramı farklı sözcüklerle ifade edip buna keşif dedi.
Geliştiriciler İçin Pratik Çıkarımlar
- Model Büyütmek Strateji Açığını Kapatmaz: Başarısız bir optimizasyonda hemen model parametresini artırmak yalnızca maliyeti ve gecikmeyi artırır; asıl çözülmesi gereken yerel minimumdan çıkmayı sağlayan arama algoritmasıdır.
- Geri Adım Mekanizması Kurgulayın: Analizci model başarısız düzenlemeleri kelime oyunlarıyla tekrarlıyorsa, arama uzayını genişleten, farklı hipotezlere dallanan ve kavramsal sıçramalar yapabilen programatik optimizasyon yapıları (örneğin DSPy benzeri derleme stratejileri) kullanılmalıdır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: DSPy ile Programatik Prompt Optimizasyonu modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →