---
title: "Zehrini Seç: Daha Güçlü LLM Arka Kapı Saldırıları İçin Zehir Kümelerinin Öğrenilerek Seçilmesi"
url: https://blog.edumints.com/zehrini-sec-daha-guclu-llm-arka-kapi-saldirilari-icin-zehir-igsuyht4
category: "LLM"
date: 2026-09-15T09:14:50.700Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.15029
---

# Zehrini Seç: Daha Güçlü LLM Arka Kapı Saldırıları İçin Zehir Kümelerinin Öğrenilerek Seçilmesi

## İnce Ayar Verilerinde Arka Kapı Tehdidi ve Rastgele Örnekleme Yanılgısı

Büyük dil modellerinde (LLM) arka kapı zehirleme saldırıları (*backdoor poisoning attacks*), temiz ince ayar (*fine-tuning*) veri setlerine az sayıda kötü niyetli örneğin enjekte edilmesiyle gerçekleştirilir. Bu saldırıların temel mekanizması, belirli bir **tetikleyiciyi** (*trigger*) modelin üretmesi hedeflenen gizli bir **hedef davranış** (*target behavior*) ile eşleştirmektir. Model normal sorgularda beklenen doğru yanıtları verirken, girdi içinde gizlenmiş tetikleyici belirdiğinde saldırganın belirlediği zararlı davranışı devreye sokar.

Mevcut güvenlik araştırmaları ve model denetimleri, genellikle zehirli örnek sayısını sabit tutmakta ve bu örnekleri aday havuzundan rastgele seçerek değerlendirme yapmaktadır. Ancak bu çalışma, rastgele seçim yaklaşımının en kötü durum güvenlik açıklarını (*worst-case vulnerability*) kritik düzeyde hafife aldığını ortaya koymaktadır:
- **LLaMA-3-8B Güvenlik Deneyleri**: Model mimarisi, temiz veri seti ve eklenen zehirli veri adedi tamamen sabit tutulduğu halde;
- Saldırı başarı oranı, yalnızca **hangi zehir kümesinin seçildiğine bağlı olarak %3 ile %80 arasında** çarpıcı bir değişkenlik göstermektedir. Bu durum, rastgele yapılan testlerin yanıltıcı bir güvenlik hissi verdiğini kanıtlamaktadır.

## SAILS: Küme Seviyesinde Öğrenilmiş Zehir Seçimi

Araştırmacılar, zehir seçim problemini kısıtlı bütçeli küme optimizasyonu (*oracle-budgeted set optimization*) olarak formüle etmekte ve bu zorluğu aşmak için **SAILS** (*Set-level Audit-Informed Iterative Learned Selection*) yöntemini sunmaktadır:
- **Etkin Küme Puanlama**: SAILS, yalnızca birkaç yüz ince ayar ve değerlendirme çalıştırmasından faydalanarak küme düzeyinde bir puanlayıcı (*set scorer*) eğitir. Bu sayede milyonlarca potansiyel aday kümeyi hızla sıralar ve yalnızca dar bir kısa listeyi doğrudan denetler.
- **Yüksek Başarı Artışı**: Geliştirilen bu yöntem, literatürdeki en güçlü etki (*influence*) tabanlı temel yöntemlere kıyasla test edilen veri kümelerindeki saldırı başarısını ortalama **30 yüzde puanı** artırmaktadır.
- **Kapsamlı Transfer Yeteneği**: SAILS, küçük ölçekli deneylerden tam ölçekli ince ayar süreçlerine sorunsuz aktarılabilmekte; kod üretimi (*code-generation*), otonom ajan (*agentic*) senaryoları ve doğrudan model ağırlıklarına erişilemeyen salt API (*API-only*) arka kapılarına kadar başarıyla genişletilebilmektedir.

## Yazılım Geliştiriciler ve Yapay Zeka Mühendisleri İçin Pratik Çıkarımlar

Bu bulgular, üretim ortamlarına LLM entegre eden geliştiriciler ve veri mühendisleri için kritik dersler barındırmaktadır:
- **En Kötü Durum Güvenlik Testleri**: Güvenlik testlerinde ortalama başarı oranlarına veya rastgele zehir örneklemelerine güvenilmemeli, modelin karşılaşabileceği en kötü durum senaryoları simüle edilmelidir.
- **Veri Tedarik Zincirinin Doğrulanması**: Üçüncü taraf açık kaynak veri setleri kullanılırken, veri kökeni (*data provenance*) sıkı biçimde takip edilmeli ve ince ayar verileri küme seviyesinde anomali testlerinden geçirilmelidir.
- **Ajan ve Kod Üretim Sistemlerinde İzolasyon**: Arka kapıların otonom araç çağırma ve kod çalıştırma sistemlerinde ciddi riskler doğurması nedeniyle, model çıktıları daima kısıtlı (*sandbox*) ortamlarda yürütülmelidir.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.15029)](https://huggingface.co/papers/2609.15029)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [AI Tedarik Zinciri Güvenliği](https://edumints.com/kesfet/ai-altyapi-guvenligi-model-supply-chain-ve-artifac-ja5f) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.15029)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/zehrini-sec-daha-guclu-llm-arka-kapi-saldirilari-icin-zehir-igsuyht4
