AI Araçları·2 dk okuma·

Ajan "Tamamlandı" Dedi, Veritabanı İtiraz Etti

Paylaş
AI AraçlarıEdumints Blog

Yapay zekâ ajanlarını ürettikleri kibar ve akıcı cümlelere göre değil, arkalarında bıraktıkları veritabanı kayıtlarına ve yan etkilere göre değerlendirmek gerekir. Microsoft ve Hugging Face ortaklığıyla geliştirilen ThinkingBox, izole Model Context Protocol (MCP) oturumlarında koşan ajanların terminal durumlarını (backend state) ve bu başarıyı art arda 20 kez tekrarlayıp tekrarlayamadıklarını ölçen yeni bir kıyaslama (benchmark) çerçevesidir.

Görünürdeki Başarı ve Gerçek Hatalar

Müşteri hizmetleri senaryosunda bir müşterinin 745 dolarlık mutfak aleti, teslimat tarihini 15 gün geçmesine rağmen kargo "istisnası" (exception) nedeniyle dağıtım merkezinde takılı kalmıştır. Ajan süreci titizlikle yürütür: Siparişi çeker, kargo takibini yapar, müşteri profilini inceler, iade politikasını iki kez kontrol eder ve destek bileti açıp süreci belgeler. Toplam 9 geçerli araç çağrısı (tool call) yapar ve müşterinin gecikme tazminatına uygun olmadığını doğru tespit eder. Ardından bileti çözüldü ("solved") olarak kapatıp müşteriye nazik bir kapanış yanıtı verir.

Araç çağrılarını veya veritabanı yazma işlemlerini yüzeysel olarak denetleyen bir değerlendirici ajanı başarılı sayacaktır. Oysa veritabanı iki noktada itiraz etmektedir:

  • Hatalı Durum Kaydı: Kargo istisnası devam ettiği için biletin nihai durumunun "beklemede" (hold) kalması gerekirken, ajan bunu çözüldü olarak işaretlemiştir.
  • Cevapsız Kalan Talep: Müşteri kargosunun akıbetine dair asıl sorduğu soruya gerçek bir yanıt alamamıştır.

Bir Araç Çağrısı Bir Sonuç Değildir

Üretim ortamında sentaks olarak geçerli bir araç çağrısı ya da hatasız sonlanan bir işlem, iş mantığının doğru işletildiğinin göstergesi değildir. Ajanlar arkalarında yanlış değerler bırakabilir, hatalı kayıtları güncelleyebilir veya istenmeyen yan etkiler üretebilir.

ThinkingBox kapsamında 12 farklı LLM modeli üzerinde gerçekleştirilen 121.680 geçerli denemede, tam 79.853 deneme yürütülebilir kontrollerden geçememiştir. Başarısız olan bu denemelerin %67,24'ü hiçbir araç hatası vermeden, temiz bir şekilde sonlanmıştır. Yürütülebilir testlerde ortaya çıkan üç temel hata imzası şunlardır:

  • Yanlış alan değerleri (%77,61): Doğru araç çağrılsa bile veritabanına hedeflenen durum yerine yanlış değerler yazılmıştır.
  • İstenmeyen ekstra yan etkiler (%43,30): İş akışının gerektirmediği fazladan ve bozucu backend işlemleri yapılmıştır.
  • Eksik zorunlu etkiler (%25,36): Senaryonun gerektirdiği zorunlu veritabanı güncellemeleri atlanmıştır.

Geliştiriciler İçin Pratik Çıkarımlar

  • Durum Odaklı Doğrulama: Ajan testlerinde yalnızca modelin ürettiği metne güvenilmemeli; arka uçta oluşan yan etkiler ve veritabanı uç durumları deterministik assertion'lar ile denetlenmelidir.
  • Tutarlılık Stres Testi: Tek seferlik başarı güvenilirlik anlamına gelmez; OpenEnv ortamında olduğu gibi 507 durum bilgili iş akışı çoklu tekrarlarla test edilerek ajanların tutarlılık maliyeti ölçülmelidir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →