AI Araçları·2 dk okuma·

Yapay Zeka Ajanları İçin Değerlendirme Sistemi (Eval Harness) Nasıl Kurulur?

Paylaş
Yapay Zeka Ajanları İçin Değerlendirme Sistemi (Eval Harness) Nasıl Kurulur?

Çalışan bir yapay zeka ajanınız var ve birisi size sistemin doğruluğundan nasıl emin olduğunuzu sorduğunda yanıtınız "yaklaşık otuz kez denedim, iyi görünüyordu" oluyorsa, bu bir prototip için kabul edilebilir. Ancak ürün gerçek kullanıcıların karşısına çıktığı an bu yaklaşım yetersiz kalır. Ajan değerlendirme sistemi (evaluation harness), "iyi görünüyordu" ifadesinin yerini alan disiplindir; yüklenen hazır bir kütüphane değil, almanız gereken dört temel karardır.

1. Karar: Test Senaryoları Nereden Gelecek?

Test vakalarını kendi hayal gücünüzle oluşturmak en büyük hatadır. Prompt'u yazan zihin yapısıyla test yazarsanız, yalnızca kendi varsayımlarınızı doğrularsınız. Oysa gerçek kullanıcılar tek mesajda üç soru sorar, gerekli bilgileri eksik bırakır ve dil değiştirir.

  • Pratik Çıkarım: Canlı ortamdaki gerçek etkileşimleri inceleyin. Başarısız olanları değil, sonuçtan emin olamadığınız 20 şüpheli vakayı seçip test setinize ekleyin. Trafiğiniz yoksa müşteri destek biletlerinden ve forum sorularından faydalanın.

2. Karar: Değerlendirme Kriterleri (Rubric) Neye Dayanmalı?

Ajanın çıktısını görmeden önce, başarılı bir yanıtın neleri içermesi gerektiğini yazılı hale getirin. Yanıtı okuduktan sonra kriter belirlerseniz, eldeki çıktıyı haklı çıkaracak taraflı bir derecelendirme yaparsınız.

  • Pratik Çıkarım: Oluşturduğunuz rubric'i iki farklı geliştiriciye verip aynı çıktıyı puanlatın. İki insan bağımsız olarak aynı puanda buluşana kadar kriterleri netleştirin. İnsanların anlaşamadığı bir sistemi otomatize etmek anlamsız metrikler üretir.

3. Karar: Değerlendirmeyi Kim Yapacak?

Değerlendirme görevini doğru mekanizmalara dağıtın:

  • Kod: API çağrıları, geçerli JSON formatı veya adım bütçesi gibi kontrol edilebilir süreçleri doğrular.
  • İnsanlar: Ton, üslup ve doğru yönlendirme gibi öznel kararları değerlendirir. Bu temel doğruluk referansınızdır (ground truth).
  • Yapay Zeka Modeli (LLM-as-a-Judge): Yalnızca elle puanladığınız en az 50 örnekte insanlarla aynı kararları verdiğini kanıtladıktan sonra otomasyona dahil edilmelidir.

4. Karar: Başarı Eşiği Nereye Konmalı?

Başarı barını (%95 gibi) prestijli görünen rasgele sayılara göre değil, sistem hatasının getirdiği gerçek maliyete göre belirleyin.

  • Pratik Çıkarım: Hata sadece garip bir cümleyse %80 yeterli olabilir. Ancak hatalı para iadesi yapmak gibi finansal bir risk varsa %95 bile yetersizdir ve insan onayı şarttır. Eşiğin yanına hata maliyetini açıkça yazın.

Dürüst Sınır: Eval Harness Ne Sağlar?

Değerlendirme sistemi ajanın kusursuz olduğunu kanıtlamaz; ajanın ne zaman değiştiğini ve iki sürümden hangisinin belirlediğiniz kriterlerde daha iyi olduğunu gösterir. Bu sistem, yazılım mühendisliği disipliniyle güvenli dağıtım yapmak ile sadece "umut etmek" arasındaki farkı oluşturur.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/sara_mo/how-do-you-build-an-evaluation-harness-for-ai-agents-2khd)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →