Yıllarca Ajan Demolarına Güvendim. Sonra "Hayır" Diyen Bir Denetim Kapısı İnşa Ettim

İçindekiler
Şimdiye kadar geliştirdiğim ve sunduğum her yapay zekâ ajanı aynı yöntemle onaylandı: Birisi çalışmasını bir kez canlı demoda izledi, başını salladı ve üretim ortamına hazır olduğunu söyledi. Yıllarca bunu yaptım ve kendi demolarıma güvendim. Sonunda beni durduran bir kontrol mekanizması geliştirdim: HivePlane. Açık kaynaklı bu kontrol düzlemi (control plane), bir ajan tekrarlanabilir bir kıyaslama testini (benchmark) geçmeden ve kriptografik imzalı bir doğrulama belgesine sahip olmadan üretim ortamına erişemez. Gerçek ajanlarla gerçekleştirilen ilk kapsamlı saha testinde 10 senaryo ve 20 kabul kriterinin tamamı başarıyla sağlandı; sürecin en kritik noktası ise hatalı durumlar için verilen erişim retleriydi.
Başlatan Cümle
Sistemi inşa ederken aklımdaki temel gerçek şuydu: "Bir ajan, yalnızca birisi demosunu izlediği için üretime hazırdır." Bu durum çoğu şirkette tembellikten değil, durumu objektif ölçecek araçların bulunmamasından kaynaklanıyor. Mevcut ajan çatıları tekil iş akışlarındaki orkestrasyonu başarıyla çözse de filo düzeyindeki kritik soruları yanıtlamıyor: Bu ajanın sahibi kim, ne kadar harcama yapabilir, hangi araçları çağırabilir ve en önemlisi kendini testlerde kanıtladı mı? SWE-bench, kodlama ajanlarına tekrarlanabilir bir benchmark ve net bir geçiş/başarısızlık ölçütü sunduğunda ajanlar belirgin biçimde gelişti. Üretim filolarında ise ekipler prompt veya modelleri hiçbir benchmark kanıtı olmadan değiştirip müşteriye ulaşan regresyonlara şaşırmaya devam ediyor.
Döngü ve İçindeki Basamaklar
Kontrol düzlemi şu döngüyü zorunlu kılar: kayıt → sertifikalandırma → geçit (gate) → çalıştırma → müdahale → teslim → izleme
Sistemin özünü oluşturan sertifikasyon basamakları ve kuralları şunlardır:
- uncertified (Sertifikasız): Kayıtlı ancak henüz benchmark yapılmamış. Yalnızca korumalı alanda (Sandbox) çalışabilir.
- provisional (Geçici): Hazırlık (staging) eşiğini (0.80) geçmiş. Yalnızca Staging ortamında çalışabilir.
- certified (Sertifikalı): Üretim eşiğini (0.90) geçmiş. Production ortamında çalışabilir.
- quarantined (Karantinada): Yeniden sertifikalandırmada başarısız olmuş veya sapma (drift) göstermiş. Çalıştırmalar tamamen engellenir.
İpucu: Üretim sertifikasyonu, hazırlık eşiğinin sadece daha yüksek bir puanla tekrarlanması değildir; bağımsız bir test koşumudur. Prompt, model veya araç gibi manifest değişiklikleri eski sertifikayı otomatik olarak geçersiz kılar.
Saha Testinin Kanıtladıkları
Canlı Docker yığını üzerinde çalışan gerçek ajanlar (saf Python destek ajanı ve LangGraph değerlendirme grafı) ile yapılan saha testinde 10 senaryoda 10/10 tam başarı sağlandı:
- support-agent: Staging aşamasında provisional olarak 1.00 (6/6) başarı oranı ve 92 ms p95 gecikmesi; üretim ortamında certified olarak 1.00 (6/6) başarı oranı ve 67 ms p95 gecikmesi kaydetti.
- eval-judge: Staging aşamasında provisional olarak 1.00 (4/4) başarı oranı ve 215 ms p95 gecikmesi; üretim ortamında certified olarak 1.00 (4/4) başarı oranı ve 126 ms p95 gecikmesi elde etti.
Bu sertifikasyon bir simülasyon değildir; çalışma zamanı adaptörü, politika sınırı ve yönetilen model katmanı üzerinden doğrudan icra edilir. Her onay, model kimliğine bağlanan ve her okumada doğrulanan Ed25519 imzalı bir kanıt üretir.
Geliştirici ve Öğrenme Çıkarımları
- Öznel kabulleri bırakın: Ajan sistemlerinde demo performansı yanıltıcıdır; geleneksel yazılım mühendisliğindeki CI/CD adımları gibi nesnel metrik eşikleri (staging için 0.80, production için 0.90) zorunlu tutulmalıdır.
- İmzasız ajan üretim ortamına çıkamaz: Model parametreleri veya prompt üzerindeki her değişiklik konfigürasyonu sıfırlamalı, kriptografik onay mekanizmalarıyla izinsiz geçişler engellenmelidir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →