---
title: "Ajanınız Görevi Başarıyla Tamamladı. Peki Bunu Tekrar Yapabilecek mi?"
url: https://blog.edumints.com/ajaniniz-gorevi-basariyla-tamamladi-peki-bunu-tekrar-yapabil-xji7x9cq
category: "AI Araçları"
date: 2026-09-16T07:11:54.392Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfblog"
source_url: https://huggingface.co/blog/ibm-research/altk-evolve-consistency
---

# Ajanınız Görevi Başarıyla Tamamladı. Peki Bunu Tekrar Yapabilecek mi?

Yapay zeka ajanınız provalarda kusursuz çalışırken, canlı demoda farklı bir rota izleyip başarısız olabilir. Bu durum sahnede utanç verici olsa da **üretim (production)** ortamında doğrudan bir güvenilirlik krizidir. Kullanıcının aynı isteği her tekrarladığında ajanın farklı davranması; finansal mutabakat veya sözleşme denetimi gibi kritik iş akışlarında kabul edilemez bir hatadır. Mevcut kıyaslama testleri (benchmark) ise bu değişkenliği çoğunlukla ortalama başarı oranlarının arkasına gizler.

IBM Research tarafından geliştirilen **ALTK-Evolve**, ajanın geçmiş çalışma yörüngelerini (trajectories) çıkarım anında modele enjekte edilen kurallara dönüştürmektedir. Sisteme eklenen **Consistency Analyzer** aracı ve tutarlılık yönergeleri, görev başarısındaki bu değişkenlik açığını doğrudan ortadan kaldırmayı hedefler.

## TL;DR (Özet Bulgular)

- **Ortalama Başarı Güvenilirlik Sorununu Gizler:** AppWorld testlerinde GPT-4.1 kullanan bir ReAct ajanı ortalama %77,4 başarı gösterirken, 5 tekrarın tamamında görevleri başarma oranı yalnızca %53,0'te kalmıştır (24,4 puanlık tutarlılık açığı). Zor görevlerde bu fark 30 puana kadar çıkmaktadır.
- **Karar Noktalarını Tespit Eden Teşhis Aracı:** Geliştirilen *Consistency Analyzer*, ajanın kayıtlı çalışma izini yeniden örnekleyerek kararın değişmeye en yatkın olduğu (flip-prone) kritik adımları tespit eder. Süreci uçtan uca tekrar çalıştırmak yerine, tek bir iz üzerinden ve referans veriye (ground truth) ihtiyaç duymadan, tek çağrıda $k=5$ tamamlama alarak dallanma noktalarını yakalar.
- **Tutarlılık Açığını Yarıya İndiren Kurallar:** Bu teşhislerin çıkarım anı yönergelerine dönüştürülmesi, ortalama doğruluktan ödün vermeden tutarlılık açığını 24,4 puandan 12,0 puana indirmiştir (aynı görevde Pass⁵ +%16,0, benzer görevlerde +%13,0 artış).

## Neredeyse Hiç Kimsenin Raporlamadığı Metrik: Mean@k ve Pass^k

Standart ajan değerlendirmelerinde genellikle **Mean@k** metriği raporlanır: test $k$ kez çalıştırılır ve ortalama başarı oranı alınır. Bu metrik bir ajanın "ortalama olarak ne kadar iyi" olduğunu gösterir; ancak gerçek bir kullanıcının önemsediği *"Aynı soruyu tekrar sorduğumda ajan yine doğru yapacak mı?"* sorusuna yanıt vermez.

Bunun için gereken metrik **Pass^k**'dır; yani ajanın $k$ denemenin tamamında başarılı olduğu görevlerin oranı.

- ⚠️ **Pass^k ile Pass@k Karıştırılmamalıdır:** Alışılageldik `Pass@k` metriği fazlasıyla iyimserdir; $k$ denemeden en az birinin başarılı olup olmadığını sorgular. `Pass^k` ise güvenilirliği garanti altına almak için tüm denemelerin istisnasız başarılı olmasını şart koşar.

## Yazılım Geliştirme Açısından Pratik Çıkarımlar

- **Metrik Standartlarınızı Güncelleyin:** Ajan mimarilerini canlıya alırken ortalama doğruluğa aldanmayın; kritik kurumsal iş akışlarında regresyon testlerinizi mutlaka `Pass^k` ile doğrulayın.
- **Maliyeti Düşürerek Hata Noktalarını İzole Edin:** Tüm ajan zincirini baştan çalıştırmak yerine, karar anlarındaki token sapmalarını izole ederek test etmek kaynak tüketimini optimize eder.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/blog/ibm-research/altk-evolve-consistency)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Production'da Agent Güvenilirliği](https://edumints.com/kesfet/production-agent-orchestration-crewai-ve-autogen-i-u3cu) modülüne göz atın.

---

**Kaynak:** [hfblog](https://huggingface.co/blog/ibm-research/altk-evolve-consistency)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/ajaniniz-gorevi-basariyla-tamamladi-peki-bunu-tekrar-yapabil-xji7x9cq
