AI Araçları·2 dk okuma·

Kendi Sertifikasyon Kapımdan Geçirmeye Çalıştığım Dört Hatalı Ajanın Tümü Nasıl Engellendi?

Paylaş
Kendi Sertifikasyon Kapımdan Geçirmeye Çalıştığım Dört Hatalı Ajanın Tümü Nasıl Engellendi?

Yazılım geliştiriciler olarak sistemlerimizin sadece başarılı senaryolarda (happy path) nasıl davrandığını test etme yanılgısına sıkça düşeriz. Geçtiğimiz günlerde, kendi geliştirdiğim HivePlane platformunun kabul kapısını (admission gate) aşmak üzere özel olarak tasarladığım kötü niyetli ve hatalı ajanlarla sistemi sınadım. Temel iddia basitti: Kendini kanıtlamamış hiçbir otonom ajan canlı ortama (production) dokunamaz. Her platform bir ajanın çalışmasını başlatabilir; ancak kritik olan, güvensiz iş yüklerine kararlılıkla "hayır" diyebilmektir. Metinde yer alan üç somut saldırı denemesi ve kapının ürettiği ret yanıtları şunlardır:

1. Sertifikasız Ajan Saldırısı (The Uncertified Agent)

En ilkel ve doğrudan saldırı: Bir ajanı kaydetmek, sertifikasyon adımlarını atlayarak doğrudan canlı ortama sürmek.

  • Kapının Yanıtı: İstek 403 koduyla geri çevrildi. İş yükünün adı, mevcut durumun yetersizliği ve canlı ortam için "certified" şartı açıkça belirtildi.
  • Yazılım ve Öğrenme Çıkarımı: Giriş kapısı (admission gate), iş yükü veritabanına kaydedilmeden ve herhangi bir yan etki üretilmeden önce tetiklenmelidir. Bu, temizlik maliyeti olmayan en ucuz denetim mekanizmasıdır. Ayrıca ret mesajı bir ürün arayüzüdür; sadece "Erişim Yasak" demek yerine geliştiriciye hangi sertifikasyonun eksik olduğunu söyleyen yönlendirici bir hata tasarımı sunulmalıdır.

2. Model Değişimi Saldırısı (The Model Swap)

Daha sinsi bir girişim: Ajanı belirli bir modelde (omlx/qwen3-4b-instruct) test edip sertifikalandırdıktan sonra, canlı dağıtıma farklı bir modelle (openai/gpt-4o) göndermek.

  • Kapının Yanıtı: Çalıştırma kimliği, manifestodaki beyan yerine doğrudan sertifikasyon onayına (attestation) bağlı modelle karşılaştırıldı ve 403 ile engellendi.
  • Yazılım ve Öğrenme Çıkarımı: Üretim ortamındaki ajan kimliği yalnızca beyana dayanamaz. Test aşamasında onaylanan model ile yürütme anındaki model arasındaki en ufak sapma doğrudan ihlal sayılmalıdır. Modeller arası yetenek ve davranış farklılıkları güvenlik açığı yaratabileceğinden, yürütme ortamı ile onaylanmış model arasındaki bağ sıkı biçimde denetlenmelidir.

3. Regresyon Saldırısı (The Regression)

Üretimde kazara yaşanması en muhtemel ve kritik tehdit: Dışarıdan bakıldığında sorunsuz çalışan ancak arka planda görevini yapmayan ajanlar. Naif ajan; GitHub sorununu okumadan tahmin yürüten, eskalasyon yapmayan ve hesap türünü uyduran bir yapıya sahipti.

  • Kapının Yanıtı: Ajan biçimsel olarak geçerli JSON üretmesine rağmen %40 başarı oranında kalarak %90 üretim eşiğini geçemedi ve 1 kritik denetim hatasıyla reddedildi.
  • Yazılım ve Öğrenme Çıkarımı: Dışarıdan makul ve biçimsel olarak doğru çıktılar üretmek, ajanın güvenilir olduğu anlamına gelmez. Manuel incelemede veya basit bir demoda başarılı sayılabilecek bir ajan, zorunlu eylemleri (örneğin mcp.github.read_issue) çalıştırmadığı için deterministik eylem denetiminde (action audit) takılmalıdır. Negatif test senaryoları tam olarak bu yanıltıcı regresyonları engellemek için vazgeçilmezdir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →