HazardAuditor: Çalıştırılabilir Tehditlerden Daha Güvenli Bilgisayar Kullanan Ajanlara
İçindekiler
Bilgisayar Kullanan Ajanlarda Çalışma Zamanı Güvenliği
Bilgisayar kullanan yapay zeka ajanları (computer-use agents); web tarayıcıları, terminaller, dosya sistemleri ve harici servislerle doğrudan etkileşime girerek giderek daha karmaşık görevleri otonom biçimde yürütmektedir. Ancak bu operasyonel yetkinlikler, güvenliğin yalnızca üretilen metin içeriği üzerinden tanımlanamayacağı yeni bir risk alanı doğurmaktadır. Ajanların oluşturduğu asıl güvenlik tehditleri, doğrudan çalışma zamanı (runtime) yürütme davranışlarından ortaya çıkmaktadır.
Mevcut güvenlik altyapılarında bu duruma yönelik iki temel yetersizlik bulunmaktadır:
- Statik Koruma Modellerinin Sınırları: Geleneksel koruma modelleri yalnızca statik istemleri ve model yanıtlarını denetleyecek biçimde tasarlanmıştır; bu nedenle ajanların dinamik yürütme süreçlerini izlemekte yetersiz kalmaktadır.
- Normalize Edilmemiş Denetim: Mevcut çalıştırılabilir güvenlik platformları, koruma modellerinin heterojen ajan çatıları genelinde öğrenebilmesi için gereken standartlaştırılmış denetim verisini üretmek yerine yalnızca nihai değerlendirme kararları (evaluation verdicts) sağlamaktadır.
HazardAuditor ve GuardPO ile Yürütme Odaklı Koruma
HazardAuditor, çalışma zamanı yürütmesini doğrudan temel alan (execution-grounded) mimarisiyle bu iki kritik boşluğu kapatmaktadır. Sistemin altyapısı; Claude Code, Codex, Hermes ve OpenClaw gibi birbirinden farklı heterojen ajanları kontrollü ortamlarda çalıştırmakta ve tüm etkileşimleri kurallı bir olay temsiline (canonical event representation) normalize etmektedir. Bu yaklaşım, çatı bağımsız ve tutarlı bir gözetim zemini sunmaktadır.
Araştırma ayrıca, belirteç düzeyindeki (token-level) eğitim hedeflerinin üretken koruma modelleri için yapısal bir uyumsuzluk yarattığını ortaya koymaktadır. Bu uyumsuzluk, modelin ürettiği uzun gerekçelerin (rationales) gradyan güncellemelerini domine etmesine ve asıl güvenlik kararının geri planda kalmasına neden olmaktadır. Bu sorunu çözmek için geliştirilen Guard Policy Optimization (GuardPO):
- Deterministik güvenlik çıktılarını dizi düzeyinde (sequence-level) avantajlara dönüştürür.
- Gerekçe ve karar bölgelerini normalize ederek doğrudan güvenlik kararını optimizasyonun temel birimi haline getirir.
Farklı kıyaslama testleri ve heterojen sistemler üzerinde yapılan değerlendirmeler, HazardAuditor'ın önceki en güçlü koruma modeline göre doğruluğu 16.5 yüzdelik puana kadar artırdığını göstermektedir. Projenin kodları, modelleri ve değerlendirme araçları açık kaynak olarak sunulmaktadır.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Çalışma Zamanı İzolasyonu: Terminal, tarayıcı ve dosya sistemine doğrudan erişen ajanlar üretim ortamlarında mutlaka kısıtlı yetkilere sahip izole sandbox alanlarında çalıştırılmalıdır.
- Kanonik Olay Kayıtları: Farklı ajan mimarilerinin operasyonel adımları standart bir olay şemasında toplanarak platformlar arası merkezi güvenlik izlemesi sağlanmalıdır.
- Karar Odaklı Optimizasyon: Ajan koruma sistemleri geliştirilirken uzun açıklamaların karar kalitesini bozmasını engelleyen dizi düzeyinde optimizasyon yöntemleri tercih edilmelidir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →