AI Araçları·2 dk okuma·

Ajanınız Görevi Başarıyla Tamamladı. Peki Bunu Tekrar Yapabilecek mi?

Paylaş
AI AraçlarıEdumints Blog

Yapay zeka ajanınız provalarda kusursuz çalışırken, canlı demoda farklı bir rota izleyip başarısız olabilir. Bu durum sahnede utanç verici olsa da üretim (production) ortamında doğrudan bir güvenilirlik krizidir. Kullanıcının aynı isteği her tekrarladığında ajanın farklı davranması; finansal mutabakat veya sözleşme denetimi gibi kritik iş akışlarında kabul edilemez bir hatadır. Mevcut kıyaslama testleri (benchmark) ise bu değişkenliği çoğunlukla ortalama başarı oranlarının arkasına gizler.

IBM Research tarafından geliştirilen ALTK-Evolve, ajanın geçmiş çalışma yörüngelerini (trajectories) çıkarım anında modele enjekte edilen kurallara dönüştürmektedir. Sisteme eklenen Consistency Analyzer aracı ve tutarlılık yönergeleri, görev başarısındaki bu değişkenlik açığını doğrudan ortadan kaldırmayı hedefler.

TL;DR (Özet Bulgular)

  • Ortalama Başarı Güvenilirlik Sorununu Gizler: AppWorld testlerinde GPT-4.1 kullanan bir ReAct ajanı ortalama %77,4 başarı gösterirken, 5 tekrarın tamamında görevleri başarma oranı yalnızca %53,0'te kalmıştır (24,4 puanlık tutarlılık açığı). Zor görevlerde bu fark 30 puana kadar çıkmaktadır.
  • Karar Noktalarını Tespit Eden Teşhis Aracı: Geliştirilen Consistency Analyzer, ajanın kayıtlı çalışma izini yeniden örnekleyerek kararın değişmeye en yatkın olduğu (flip-prone) kritik adımları tespit eder. Süreci uçtan uca tekrar çalıştırmak yerine, tek bir iz üzerinden ve referans veriye (ground truth) ihtiyaç duymadan, tek çağrıda $k=5$ tamamlama alarak dallanma noktalarını yakalar.
  • Tutarlılık Açığını Yarıya İndiren Kurallar: Bu teşhislerin çıkarım anı yönergelerine dönüştürülmesi, ortalama doğruluktan ödün vermeden tutarlılık açığını 24,4 puandan 12,0 puana indirmiştir (aynı görevde Pass⁵ +%16,0, benzer görevlerde +%13,0 artış).

Neredeyse Hiç Kimsenin Raporlamadığı Metrik: Mean@k ve Pass^k

Standart ajan değerlendirmelerinde genellikle Mean@k metriği raporlanır: test $k$ kez çalıştırılır ve ortalama başarı oranı alınır. Bu metrik bir ajanın "ortalama olarak ne kadar iyi" olduğunu gösterir; ancak gerçek bir kullanıcının önemsediği "Aynı soruyu tekrar sorduğumda ajan yine doğru yapacak mı?" sorusuna yanıt vermez.

Bunun için gereken metrik Pass^k'dır; yani ajanın $k$ denemenin tamamında başarılı olduğu görevlerin oranı.

  • ⚠️ Pass^k ile Pass@k Karıştırılmamalıdır: Alışılageldik Pass@k metriği fazlasıyla iyimserdir; $k$ denemeden en az birinin başarılı olup olmadığını sorgular. Pass^k ise güvenilirliği garanti altına almak için tüm denemelerin istisnasız başarılı olmasını şart koşar.

Yazılım Geliştirme Açısından Pratik Çıkarımlar

  • Metrik Standartlarınızı Güncelleyin: Ajan mimarilerini canlıya alırken ortalama doğruluğa aldanmayın; kritik kurumsal iş akışlarında regresyon testlerinizi mutlaka Pass^k ile doğrulayın.
  • Maliyeti Düşürerek Hata Noktalarını İzole Edin: Tüm ajan zincirini baştan çalıştırmak yerine, karar anlarındaki token sapmalarını izole ederek test etmek kaynak tüketimini optimize eder.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →