ProofSec: Öncü LLM'lerde Epistemik Sağlamlık ve Kanıta Dayalı Zafiyet Muhakemesi

İçindekiler
Kaggle Kıyaslama Yarışması kapsamında sunulan ProofSec, kritik bir soruyu ele alır: Bir büyük dil modeli (LLM); IDOR, BOLA, yetkilendirme atlatma ve tahmin edilebilir tanımlayıcılar gibi bir zafiyetle ilişkili tüm anlamsal kalıpları tanıdığı halde, eldeki mevcut kanıtlar bu zafiyetin gerçekte var olduğunu doğrulamıyorsa ne olur?
ProofSec; modellerin güvenlik göstergeleri ile doğrulayıcı kanıtları ayırt etme, eksik ve çelişkili gözlemler altında akıl yürütme, terminoloji ve otorite yanlılığına direnme, yanlışlayıcı kanıtları sürece dahil etme ve epistemik temeli olmayan sonuçları açıkça fark etme yeteneklerini değerlendiren kanıt odaklı bir kıyaslama çerçevesidir.
Sorun: Güvenlik Muhakemesi Bir Örüntü Eşleme Değildir
Büyük dil modelleri anlamsal getirmede oldukça başarılıdır. Modele GET /api/users/2841/invoices/9281 uç noktası ve tahmin edilebilir sayısal tanımlayıcılar sunulduğunda, şu kavram alanını hızla devreye sokar:
- IDOR
- BOLA
- Kırık Erişim Kontrolü (Broken Access Control)
- Yetkilendirme Atlatma (Authorization Bypass)
Ancak bir zafiyetin anlamsal imzasını tanımak ile güvenlik ilkesinin gerçekten ihlal edildiğini kanıtlamak arasında temel bir ayrım vardır. Muhakeme sistemlerinin güvenilmezleştiği nokta tam olarak burasıdır.
Şu senaryoyu ele alalım:
- Kimliği doğrulanmış kullanıcı: 2841
- İstek:
GET /api/invoices/9281 HTTP/1.1 - Yanıt:
200 OKve{ "invoice_id": 9281, "amount": 45000, "status": "paid" }
Bu bir IDOR mudur? Eldeki gözlem şunları bağımsız olarak kanıtlamaz:
- 9281 numaralı faturanın kime ait olduğunu,
- Kimliği doğrulanmış kullanıcının buna erişim yetkisi olup olmadığını,
- Nesnenin farklı bir kullanıcıya ait olup olmadığını,
- Bir yetkilendirme kuralının ihlal edilip edilmediğini,
- Erişim kontrolünün üst veya alt katmanda uygulandığını,
- Uç noktanın korunan asıl kaynağı temsil edip etmediğini,
- Yanıtın gerçek üretim ortamı verilerinden gelip gelmediğini,
- Yanıtın sentetik, önbelleğe alınmış ya da test amaçlı oluşturulup oluşturulmadığını.
Tahmin edilebilir bir tanımlayıcı göstergedir; HTTP 200 yanıtı ise gözlemdir. İkisi de tek başına yetkisiz erişimin kanıtı değildir. ProofSec'in temel ilkesi şudur: Güvenlik göstergesi, güvenlik kanıtına eşit değildir.
Neyi Kıyasladım?
ProofSec, kanıta duyarlı zafiyet sınıflandırmasını değerlendirir. Modelin güvenlik durumunu tam olarak şu üç kanonik kategoriden birine sınıflandırması gerekir:
- Zafiyet Var (Vulnerable)
- Zafiyet Yok (Not Vulnerable)
- Yetersiz Kanıt (Insufficient Evidence)
Üçüncü seçenek bilerek birinci sınıf bir durum olarak eklenmiştir. Geleneksel ikili sınıflandırmalar modelleri EVET ya da HAYIR şeklinde zoraki kararlara yönlendirir. Oysa gerçek güvenlik incelemelerinde kanıtlar eksik, telemetri yetersiz veya gözlemler belirsiz olabilir.
Yazılım Geliştirme ve Öğrenme Çıkarımları
Yazılım geliştiriciler ve AI araştırmacıları için pratik çıkarımlar:
- Örüntü Yanılgısı: Tahmin edilebilir URL parametreleri tek başına açık kanıtı değildir; yetkilendirme kontrolleri kod düzeyinde doğrulanmalıdır.
- Belirsizlik Yönetimi: Güvenlik değerlendirmelerinde LLM kullanırken modele "Yetersiz Kanıt" seçeneği tanınmalı, model somut veri olmadan karar vermeye zorlanmamalıdır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →