Aynı Baytlar, Farklı Otorite: Sohbet Şablonu Prompt Injection Saldırılarında Ayrılmış Belirteç Temsilleri
İçindekiler
Giriş ve Temel Sorun
Büyük dil modeli (LLM) ajanlarına yönelik prompt injection saldırıları, enjekte edilen talimat modelin kendi sohbet şablonuyla sarmalandığında çok daha güçlü ve etkili hale gelmektedir. Saldırganın oluşturduğu <|im_start|> gibi sahte bir şablon belirteci, modele ya tek bir ayrılmış kontrol belirteci (reserved control token) ya da sıradan alt kelime belirteçleri (subwords) dizisi olarak ulaşabilir.
Bu iki biçim de birebir aynı metne çözümlenir; ancak belirteçleme (tokenization) sunucu tarafında çalıştığı için modelin hangi temsili alacağını saldırgan değil, savunmacı belirler. Bu çalışma, enjekte edilen talimatın otoritesinin ne kadarının ayrılmış belirtecin öğrenilmiş temsilinden kaynaklandığını analiz etmektedir.
Temel Bulgular ve Deneysel Sonuçlar
- Saldırı Başarısındaki Düşüş: Metin sabit tutulup eklenen belirteçler kontrol edildiğinde, sahte işaretleyicilerin alt kelime olarak kodlanması, dört açık ağırlıklı model ailesinin üçünde InjecAgent kıyaslama testinde saldırı başarı oranını 39 ila 66 yüzdelik puan düşürmektedir. Bu başarı farkı, AgentDojo üzerindeki çok turlu ajan görevlerinde de geçerliliğini korumaktadır.
- Qwen3-8B ve Akıl Yürütme Ayrımı: Qwen3-8B modelinde bu fark yalnızca 8 puanda kalmaktadır; çünkü model, ayrılmış kimlikler olmadan da sahte konuşma sırasını akıl yürütme (reasoning) ile metinden tanıyabilmektedir. Akıl yürütme bloğu bastırıldığında ise bu fark 50 puana yükselmektedir.
- Otoritenin Vektörel Kaynağı: Otorite, doğrudan işaretleyici pozisyonundaki tekil öğrenilmiş vektörde yatmaktadır. Alt kelime vektörlerinin ortalaması bu otoriteyi yeniden üretemez. Llama-3.1'de en yakın sıradan belirtecin vektörü saldırıyı yeniden tetiklemekte ve adaptif saldırganlar dört ailenin üçünde bu tür gömme (embedding) komşularını tespit edebilmektedir.
- Instruction Tuning'in Etkisi: İncelenen tüm temel (base) ve komutla eğitilmiş (instruction-tuned) model çiftlerinde, instruction tuning sürecinin modelin ayrılmış belirteçlere duyduğu tercihi ve güveni belirgin biçimde güçlendirdiği görülmüştür.
- Standart Hafifletmenin Sınırları ve Araç Protokolleri: Özel belirteçleri alt kelimelere dönüştüren standart tokenizer yapılandırması, sadece açıkça özel tanımlanmış belirteçleri kapsar. Hugging Face'teki en çok indirilen 400 sohbet modelinin 255'ini temsil eden 67 farklı tokenizer konfigürasyonunun 33'ünde, ajanların güvenilmeyen araç çıktılarını okuduğu araç protokol belirteçleri savunmasız kalmakta ve güvenlik açığı devam etmektedir.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Sunucu Taraflı Belirteçleme Denetimi: Kullanıcıdan veya harici web kancalarından gelen ham metinlerin ayrılmış kontrol belirteçlerine dönüşmesini engellemek için tokenization aşamasında alt kelime kodlaması zorunlu kılınmalıdır.
- Araç Çıktılarında (Tool Outputs) İzolasyon: Ajan mimarilerinde üçüncü taraf araç yanıtları sisteme beslenirken, standart filtrelerin yakalayamadığı araç protokol belirteçleri özel olarak taranmalı ve temizlenmelidir.
- Akıl Yürütme ve Gömme Seviyesi Güvenlik: Gelişmiş akıl yürüten modeller belirteç kimliği olmadan da enjeksiyonu metinden çıkarabileceğinden ve adaptif saldırganlar embedding komşularını kullanabileceğinden, savunma yalnızca tokenizer seviyesinde bırakılmamalı, çok katmanlı doğrulama uygulanmalıdır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Inference Saldırıları modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →