Benchmark Testleriniz Gerçeği Söylediğinde: LLM Değerlendirmesinde Test Altyapısı Yanılgısı

İçindekiler
Yapay zekâ ajanlarının (agent) tekrarlayan hatalarını kalıcı kurallara dönüştüren açık kaynaklı sidecar aracı CauterRule, v0.1.0 sürümüyle GitHub ve PyPI üzerinde yayınlandı (pip install cauterule). CLI arayüzü, MCP sunucusu, 7 farklı formata dışa aktarım ve hazır bir git kural paketi sunan araç; başarısız yörüngelerden (trajectory) aday kurallar çıkarıp geçmiş testlerle yeniden oynatarak yalnızca güvenli olanları sisteme dahil ediyor.
Model Yetersizliği mi, Test Altyapısı Hatası mı?
CauterRule’un 4 model ve 394 yörüngeyi kapsayan saha testlerinde ilk sonuçlar oldukça karamsardı: Yerel modeller zayıf görünüyor, ayrıştırma (parse) hataları sıkça yaşanıyor ve bazı veri dilimleri çalıştırılamıyordu. İlk refleks suçu doğrudan modele atmaktı. Ancak düzeltmeler sonrası tekrarlanan testler gerçeği ortaya koydu: Başarısızlığın önemli bir kısmını model değil, bizzat benchmark altyapısının (harness) kendisi üretiyordu.
Öncesi ve Sonrası: Rakamların Gösterdiği Gerçek
Parser, prompt, sonuç sıfırlama ve zaman damgası düzeltmelerinin ardından elde edilen farklar göz ardı edilemeyecek kadar büyüktü:
- Local Llama golden ayrıştırılan satırlar: 3 / 11 satırdan 10 / 10 satıra yükseldi.
- Local Qwen golden ayrıştırılan satırlar: 3 / 10 satırdan 10 / 10 satıra ulaştı.
- Ham sentetik işlenen satırlar: 124 / 145'ten 145 / 145 seviyesine çıktı.
- Ham sibling-repo işlenen satırlar: 0 / 10'dan 10 / 10 tam kullanılabilir veriye dönüştü.
İlk test altyapısı, golden veri kümesindeki sinyalin %73'ünü çöpe atıyordu. Aslında model kalitesi değil, parser kırılganlığı ölçülüyor ve bu durum "model kalitesi" olarak etiketleniyordu. Bu hatalı verilere dayanarak ürün yol haritası çizilseydi, geliştirme ekipleri aylarca yanlış katmanı optimize etmekle vakit kaybedecekti.
Aslında Ne Kırıktı? Dört Temel Altyapı Hatası
Saha testleri, model hatası sanılan dört kritik altyapı problemini açığa çıkardı:
- Yinelenen satırlar: Model tutarsızlığı gibi görünüyordu; ancak aynı günkü çalıştırma sonuçlarının sıfırlanmadan üst üste eklenmesinden (result append contamination) kaynaklanıyordu.
- Geçerli çıktılarda ayrıştırma hatası: Modelin zayıflığı zannedildi; oysa parser gereğinden fazla metin bağlamı yakaladığı için patlıyordu.
- Bağlam doğrulama hatası: Hatalı çıkarım sanıldı; aslında boş bağlam öğeleri gereksiz yere aşırı agresif biçimde reddediliyordu.
- Engellenen ham çalıştırmalar: Model veya çalışma zamanı hatası sanıldı; gerçekte girdi sözleşmesindeki eksik zaman damgalarından (timestamps) kaynaklanıyordu.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
Bu deneyim, LLM ve ajan sistemlerinde test mühendisliği açısından hayati bir ders barındırıyor: 10 yörüngelik bir testte 11 satır sonuç çıkması modelin kararsızlığı değil, test ortamının kirlendiğinin kanıtıdır. Bir modelin görevde başarısız olduğunu varsaymadan önce veri boru hatlarını, girdi sözleşmelerini ve parser dayanıklılığını doğrulamak gerekir; aksi takdirde yanlış katmanı optimize etme tuzağına düşülür.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/debashish_ghosal/when-your-benchmark-finally-tells-the-truth-534h)
Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →