Yazılım·2 dk okuma·

0/60 Sorunu Model Kaynaklı Değildi: En Kötü İki Korpusun Arkasındaki Boş Samanlık

Paylaş
0/60 Sorunu Model Kaynaklı Değildi: En Kötü İki Korpusun Arkasındaki Boş Samanlık

Yapay zeka destekli ajan sistemlerinde bir değerlendirme kümesinde %0 başarı görüldüğünde ilk refleks genellikle aynıdır: "Model bu tür hataları çözemiyor." CauterRule'un v0.3.1 sürüm saha testi raporu, bu peşin hükmün yanıltıcılığını ve asıl problemin model kapasitesinde değil, veride olduğunu somut biçimde ortaya koyuyor.

Tekrarlanan ajan hatalarından kalıcı kurallar çıkaran (çıkar, yeniden test et, yükselt) açık kaynaklı bir yan araç (sidecar) olan CauterRule; 40 korpus ve 4.742 yörünge çalıştırmasında iki bulut modeliyle test edildi. v0.3.0 sürümünden devreden en sorunlu iki küme şunlardı: adapters (iki modelde de 0/60, %100 matcher_gap) ve raw/ci (0/110). Her iki başarısızlığın arkasındaki kök neden veri eksikliğiydi; gerekli veri düzeltmeleriyle sonuçlar sırasıyla 60/60 ve 21–26/47 seviyesine yükseltildi.

Teşhisi Değiştiren Kriter: matcher_gap ve no_signal Ayrımı

Yeniden oynatma (replay) testlerinde sonuçsuz kalan durumları doğru sınıflandırmak tüm analiz sürecini değiştirdi:

  • no_signal: Model hiçbir aday kural üretemedi veya adayın eşleşebileceği hiçbir zemin yoktu. Sorumlu: Model (veya filtre mekanizması).
  • matcher_gap: Model geçerli bir kural adayı üretti; ancak referans havuzunda karşılaştırma yapılabilecek hiçbir veri dönmedi. Sorumlu: Veri havuzu.

adapters korpusundaki %100 matcher_gap, modelin LangGraph, CrewAI ve PydanticAI kurallarını başarıyla çıkardığını; fakat referans havuzunda bu kütüphanelere ait hiçbir yörünge bulunmadığı için adayın boşluğa düştüğünü gösterdi. Kısacası samanlık tamamen boştu.

Uygulanan İki Temel Veri Düzeltmesi

  • Düzeltme 1 (#726) - Boş Adaptör Havuzunun Doldurulması: Modele dokunulmadan referans havuzuna LangGraph, CrewAI ve PydanticAI için etki alanına uygun referans imzaları eklendi. Sonuç tek döngüde 0/60'tan doğrudan 60/60 tam geçişe ulaştı. Model başından beri doğru çalışıyordu; eksik olan referans verisiydi.
  • Düzeltme 2 (J11) - CI Samanlığındaki Dört Katmanlı Veri Hatası: raw/ci kümesi 0/110'dan 21–26/47 seviyesine (~%45–55) çıkarıldı. Dört bağımsız veri hatasından ilki log toplayıcıdaydı: collect-ci-corpus-v2.py betiği, CI logunun en başındaki 2.000 karakterlik başlatma/checkout şablonunu kaydediyordu. Asıl hata metni ise logun en altındaydı; bu nedenle 110 yörüngenin 99'unda gerçek hata metni bile bulunmuyordu.

Yazılım Geliştirme ve Öğrenme Çıkarımları

  • %0 Bir Hüküm Değil, Bir Sorudur: Başarısızlık anında modeli değiştirmeden veya karmaşık prompt ayarlarına girmeden önce mutlaka "Samanlıkta ne var?" sorusu sorulmalıdır.
  • Hata Kaynağını Doğru Ayrıştırın: Model yetersizliği (no_signal) ile doğrulama veri setinin eksikliğini (matcher_gap) net biçimde ayırmak, gereksiz model optimizasyonu maliyetlerini önler.
  • Veri Toplama Boru Hatlarını Denetleyin: CI ve log analizi yapan ajanlarda, verinin doğru kesitten (başlangıç yerine hata kuyruğu) toplandığı doğrulanmadan model performansı yargılanamaz.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →