EvoSafeHarness: LLM Ajanları İçin Modele ve Alana Özgü Dinamik Güvenlik Katmanları
İçindekiler
Ajan Güvenliğinde Statik Zırhların Yetersizliği
Büyük Dil Modeli (LLM) ajanlarının metin üretiminin ötesine geçerek harici araçlar ve API'ler üzerinden gerçek dünyada somut etkiler yaratması, sistem güvenliğini vazgeçilmez bir öncelik haline getirmiştir. Bu otonom yapılar hem harici veri kaynaklarına sinsice yerleştirilen dolaylı komut enjeksiyonları (indirect prompt injections) hem de doğrudan gelen zararlı kullanıcı istekleri karşısında savunmasız kalabilmektedir. Sistem düzeyindeki güvenlik katmanları (safety harnesses), model düzeyindeki temel korumaların ötesinde kritik bir denetim mekanizması sağlar. Ancak mevcut zırhlar çoğunlukla uzmanlar tarafından statik olarak tasarlanmakta ve heterojen modeller ile farklı uygulama alanlarına tek tip biçimde uygulanmaktadır.
Pratikte ise etkili bir savunma tamamen dağıtım ortamına bağımlıdır:
- Model Düzeyinde Hassasiyet: Modellerin fayda ve görev başarım (utility) kaybı yaşamadan tolere edebileceği güvenlik kısıtlaması derecesi farklıdır. Bir model için ideal olan sıkı bir denetim, başka bir modelin meşru görev akışını aşırı engelleyebilir (over-blocking).
- Alan Düzeyinde Değişkenlik: Finans, e-ticaret veya yazılım geliştirme gibi alanların her biri; yönetilmesi gereken benzersiz eylem dizileri, sistem durumları ve etki sınırları barındırır. Alanlar arasında genel geçer biçimde aktarılan kurallar, uygulamaya özel kritik güvenlik ilişkilerini gözden kaçırabilmektedir.
EvoSafeHarness: Güvenlik Politikası ve Kod Mantığının Birlikte Evrimi
Bu temel darboğazı aşmak amacıyla geliştirilen EvoSafeHarness, hedef alandaki dondurulmuş (frozen) bir model için üretime hazır bir güvenlik zırhı sentezleyen optimizasyon çerçevesidir. Sistem, model davranışları ve alan spesifikasyonlarının rehberliğinde hem doğal dil güvenlik politikasını hem de yürütülebilir kod mantığını ortaklaşa arar. Sentetik ve kıyaslamaya özel kuralları elemek amacıyla taze bağlamlı hasmane inceleme (fresh-context adversarial review) mekanizmasını devreye sokar.
Dört farklı ajan test ailesinde EvoSafeHarness, sabit uzman tasarımlarına kıyasla çok daha güçlü bir güvenlik-fayda sınırı elde etmiştir:
- DecodingTrust-Agent: Ortalama saldırı başarı oranını (ASR) yalnızca 3.3 puanlık fayda maliyetiyle %45.6'dan %10.0'a düşürmüş ve 15 test hücresinin 14'ünde en yüksek performansı yakalamıştır.
- AgentDojo: %0.0 saldırı başarı oranında %82.8 gibi yüksek bir fayda korumuş; aynı çalışma noktasında CaMeL savunmasının iki katı işlevsellik sunmuştur. Üstelik hiç görmediği AgentDyn test paketlerine değişmeden başarıyla aktarılmıştır.
- Agent-SafetyBench ve Uyarlamalı PAIR: Test edilen her kurban modelde en iyi skoru elde etmiş, 16 adımlık yineleme bütçesine sahip gelişmiş uyarlamalı PAIR saldırıları altında dahi ortalama ASR'yi %20'nin altında tutmuştur.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Çift Katmanlı Koruma Mimarisi: Güvenliği yalnızca sistem prompt'larına bırakmayın; doğal dil politikaları ile Python tabanlı yürütülebilir doğrulama kodlarını birlikte kurgulayın.
- Durum ve Semantik Ayrımı: Alan semantiği hangi durumların ve güvenlik ilişkilerinin izleneceğini, modelin çalışma zamanı davranışı ise bu kuralların nerede ve nasıl denetleneceğini belirlemelidir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.05903)
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →