Güvenlik Aracımın Yakalayamadığı Her Kusuru Yayınladım: Bu Onu Daha Az Değil, Daha Güvenilir Kıldı

İçindekiler
Kusursuz olduğunu iddia eden açık kaynaklı bir güvenlik aracı, kendi zayıflıklarını ve açıklarını şeffafça paylaşan bir araçtan her zaman daha az güvenilirdir. PlannerCritic serisinin bu bölümünde, kendi planlama motorumuzu kırmaya çalıştığımızda ortaya çıkan ve henüz kapatamadığımız kritik sistem açıklarını ele alıyoruz. v0.2.3 güncellemesiyle hata modu kayıtlarımız F-20 (#296) eklenerek 15'ten fazla satıra ulaştı ve redaksiyon katmanlarının sayısal verileri sessizce bozmasını engelleyen verify_transit_integrity kontrolü devreye alındı.
Karşı Koyduğum Cazibe
Geliştirdiğim ajan planlama motoru; 11 düşmanca hedefin tamamını, SWE-bench kaynaklı 35 kusurlu varyantı ve oluşturulan 21 enjeksiyon tuzağını başarıyla engelledi. İlk bakışta "İstem mühendisliği değil, mimari güvenliği sağladı; 11'de 11 yaptık ve bitti" demek büyük bir cazibeydi. Ancak gelen en nitelikli geri bildirimler tebrik etmek yerine, görmezden geldiğim zayıf noktaları işaret ediyordu. Bu açıkları GitHub üzerinde kayıt altına alıp açıkça yayımlamak, projeyi zayıflatmak yerine ona gerçek bir güvenilirlik kazandırdı.
Açıkta Kalan İki Kritik Zayıf Nokta
Metinde tespit edilen ve deterministik kapıların henüz tek başına çözemediği temel açıklar şunlardır:
- 1. Araç Çıktıları Üzerinden Dolaylı Enjeksiyon (Indirect Injection Through Tool Outputs): Test senaryolarında zararlı yük daima başlangıçtaki hedef metnine yerleştirilmişti. Deterministik kapılar hedef metnini okumadığı için bu saldırılar kolayca bertaraf edildi. Asıl zorluk; denetim sonrasında web sayfaları, güvenilmeyen API yanıtları veya veri tabanlarından dönen araç çıktılarında gizlenen zararlı içeriklerdir. Eleştirmen (critic), ajanın tükettiği her araç sonucunu baştan denetlemez. Çözüm (#249), LLM'lerle her çıktıyı tekrar denetlemek yerine araçların tiplendirilmiş veri ve kaynak kökeni (provenance) döndürmesidir. Böylece harici kaynaklar keşif yapabilir ancak yetkilendirilmiş kritik alanları (tutar, alıcı vb.) asla değiştiremez.
- 2. İyi Yapılandırılmış Kötü Niyetli Planların Yapısal Kontrolleri Aşması (Well-formed Malicious Plans Defeat Structural Checks): Deterministik kapılar anlamsal niyeti değil, yalnızca yapısal bütünlüğü denetler. Saldırgan, planına sahte bir geri alma (dummy rollback) ve kukla bir doğrulama adımı eklerse linter kontrolünü aşabilir. Kapılar yapısal olarak doğru görünen her planı onaylar. Bu durum, anlamsal güvenlik ile biçimsel doğrulama arasındaki sınırı gösterir.
Yazılım Geliştirme ve Öğrenme Çıkarımları
Üretim ortamında otonom ajanlar inşa ederken alınması gereken temel pratik dersler:
- Kaynak Kökeni ve Tip Ayrımı: Harici veriyi doğrudan istem içine gömmek yerine tiplendirilmiş veri yapıları ve kaynak doğrulaması kullanın.
- Biçimsel Denetim Yetersizliği: Yalnızca sözdizimi veya yapı kontrolü yapan linter'lar semantik saldırıları engelleyemez; çok katmanlı denetim mekanizmaları kurulmalıdır.
- Açık Dokümantasyon Kültürü: Sistemin sınırlarını ve kırılma noktalarını gizlemek yerine şeffafça paylaşmak mühendislik kalitesini yükseltir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →