LLM·3 dk okuma·

Değerlendiriciniz Karar Veremediğinde: Ajan Testlerinde Kararsız Sonuçların Gizli Rolü

Paylaş
Değerlendiriciniz Karar Veremediğinde: Ajan Testlerinde Kararsız Sonuçların Gizli Rolü

Açık kaynaklı bir sidecar aracı olan CauterRule, v0.1.0 sürümüyle GitHub ve PyPI üzerinde yayınlandı. Araç; tekrarlanan ajan (agent) hatalarından kalıcı kurallar çıkarmayı amaçlıyor (çıkar, yeniden oynatarak test et, yükselt). Geliştiricilere tam kapsamlı CLI, MCP sunucusu, 7 dışa aktarma formatı ve hazır bir git kural paketi sunan sistemin saha testi; 4 model ve 394 çalışma yörüngesi (trajectory) üzerinden değerlendirildi. CauterRule, yörüngelerden çıkarılan dersleri yeniden oynatma testine tabi tutarak yeniden kullanılabilir rehberliği gürültülü aşırı genellemelerden ayırır.

Her kıyaslama (benchmark) üç kategori üretir: başarılı (pass), başarısız (fail) ve belirsiz (inconclusive). Çoğu geliştirici yalnızca ilk ikisine odaklanır; ancak CauterRule saha testinde üçüncü kategori, diğer ikisinin toplamından daha büyüktü ve en kritik olanıydı.

Sonuçlarımızın Çoğunluğu "Kararsızdı"

Dört model genelindeki 1.538 aday kuralın dağılımı şu şekildedir:

  • Başarılı (Pass): 365 (%23,7)
  • Başarısız (Fail): 359 (%23,3)
  • Belirsiz (Inconclusive): 814 (%52,9)

Sonuçların yarısından fazlasında yeniden oynatma motoru kuralın iyi veya kötü olduğuna karar veremedi; adayı onaylamadı veya reddetmedi, yalnızca "belki" yanıtı verdi. Çoğu test raporu bu belirsiz kategoriyi göz ardı eder, çünkü değerlendirme aracının işini yapamadığını kabul etmek zordur. Ancak bu grubu yok saymak, verinin yarısından fazlasını görmezden gelmek ve yanlış çıkarımlar yapmaktır.

Belirsizlik Oranı Modele Göre Değişti — Ama Beklenmedik Şekilde

Adayların modellere göre belirsizlik dağılımı:

  • Local Llama 3.2B: 379 aday, 189 belirsiz (%49,9)
  • Local Qwen 4B: 373 aday, 209 belirsiz (%56,0)
  • Cloud GPT-4o-mini: 394 aday, 248 belirsiz (%62,9)
  • Cloud Llama 3.1 8B: 392 aday, 168 belirsiz (%42,9)

En güçlü bulut modeli olan Llama 3.1 8B, %42,9 ile en düşük belirsizlik oranına sahipti; daha net tetikleyiciler üreterek doğrulamayı kolaylaştırdı. Buna karşın ticari GPT-4o-mini, yerel modellerden bile daha yüksek (%62,9) belirsizlik oranıyla en kararsız model oldu. Ham başarı sayıları benzer görünse de GPT-4o-mini daha kalitesiz değil, daha zor puanlanabilir (less scorable) çıktılar üretti.

"Belirsiz" (Inconclusive) Gerçekte Ne Anlama Geliyor?

Yeniden oynatma motoru aday kuralı referans yörüngelere karşı çalıştırır; tetikleyicinin doğru senaryolarda devreye girip (recall) yanlışlarda sessiz kalıp kalmadığını (precision) kontrol eder:

  • Pass: Hem kesinlik hem de duyarlılık yeterince yüksek olduğunda verilir.
  • Fail: Kural açıkça yanlış senaryolarda tetiklendiğinde veya doğru durumları tamamen kaçırdığında verilir.
  • Inconclusive: İki koşul da net biçimde karşılanmadığında döner.

Karar verici karmaşık bir yargıç değil; alt dizgi (substring) ve belirteç örtüşmesi (token-overlap) sezgisellerini kullanır.

Yazılım Geliştiricileri İçin Pratik Çıkarımlar

  • Metrik Yanılsamasından Kaçının: Ajan mimarilerinde sadece Pass/Fail metriklerine odaklanmak yanıltıcıdır; sistemik zayıflıklar çoğunlukla gri alanda gizlidir.
  • Puanlanabilir Tasarım Yapın: Kuralları ve prompt'ları, değerlendirici araçların net karar verebileceği biçimde yapılandırın.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/debashish_ghosal/when-your-judge-cant-decide-1252)


Bu konuyu derinlemesine öğrenmek isterseniz: LLM-as-a-Judge ve Braintrust modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →