Fine-Tuning Sırasında LLM Veri Zehirlenmesini Önleyen Epistemik Kapı: 5 Mimaride 0 Dolar Maliyetle Test Edildi

İçindekiler
Yapay zeka dünyasında güvenlik araştırmaları, veri zehirlenmesi (data poisoning) denetimleri ve model hizalama çalışmalarının yalnızca milyonlarca dolarlık devasa GPU kümeleriyle yapılabileceğine dair yaygın bir inanış vardır. Bu çalışmada söz konusu anlatıyı test etmek amacıyla; orkestrasyonu 2006 model bir Toshiba Satellite (2 GB RAM) dizüstü bilgisayarda yürütülen ve hesaplama için ücretsiz Kaggle T4 GPU'larını ($0 maliyet) kullanan 16 deneylik kapsamlı bir seri (EXP08–EXP16) gerçekleştirildi. Büyük dil modellerindeki epistemik çöküşü ve veri zehirlenmesini inceleyen bu çalışmanın ilk aşaması olarak açık kaynaklı Beatriz Epistemic Gate geliştirildi.
Bu Çözüm Hangi Problemi Çözüyor?
Fine-tuning (ince ayar) süreçlerindeki kötü niyetli veri zehirlenmesi saldırıları genellikle cerrahi bir hassasiyetle gerçekleşir ve standart perplexity (şaşkınlık) gibi toplu metriklerde görünmez kalır. Bir saldırgan, genel metrikler akıcı metinler üzerinde yapılan eğitim sayesinde iyileşirken belirli olgusal gerçekleri tam bir kayıtsızlık noktasına kadar yok edebilir. Bu sinsi tehdit, özellikle açık kaynaklı yerel modelleri eğiten bağımsız geliştiriciler ve girişimler için ciddi bir güvenlik açığı yaratır.
Beatriz Nasıl Çalışıyor?
Beatriz, karmaşık eğitim döngülerini yeniden yazmak yerine üretici kaynak ile eğitilen öğrenci model arasında konumlanan hafif ve müdahalesiz bir savunma proxy'si (~0,1 ms karar gecikmesi) olarak işlev görür. Üretilen metni, gömme (embedding) uzayındaki kosinüs benzerliği üzerinden değişmez bir referans korpusla (anchor corpus) doğrular ve bileşik bir kayıp fonksiyonu uygular:
- $L_{ce}$: Dilbilgisel akıcılığı korur.
- $L_{contrastiva}$ (Softplus): Çapraz entropi doyuma ulaştıktan sonra bile modelin gerçeğe çıpalanması için aktif baskı uygular.
Temel Sonuçlar (EXP08–EXP16)
- Çoklu mimari doğrulaması: GPT-2 (124M), Qwen-2.5-0.5B, TinyLlama-1.1B, Pythia-1.4B ve Phi-3-mini-4k-instruct (3.8B) mimarilerinde başarıyla test edildi.
- Ablasyon (EXP15): Saf filtreleme (GATE_ONLY) savunma avantajının tek başına %65'ini sağlarken, kontrastif terim kalan %35'lik korumayı tamamladı.
- Ölçeklendirilmiş Held-Out (EXP16): Saldırıya uğramamış 30 çok alanlı olgu kıyaslamasında doğrulandı; kapıda 0.93 kesinlik (precision) ve 0.80 duyarlılık (recall) ile +4.19 ± 0.08'lik güçlü bir doğruluk marjı elde edildi.
Depoda Şu Anda Neler Var?
Topluluğu aşırı yüklememek adına proje aşamalı olarak yayımlanmaktadır:
- Kaggle üzerinde tamamen yeniden üretilebilir EXP08 ve EXP09 kodları ve not defterleri.
- 16 deneyin tamamını detaylandıran Teknik Whitepaper (
WHITEPAPER.md/WHITEPAPER.es.md). - Biçimsel matematiksel kayıp fonksiyonu spesifikasyonlarını içeren Düzeltici Kılavuz (
docs/MANUAL_CORRECTIVO.md).
Geliştiriciler İçin Pratik Çıkarımlar ve Tehdit Modeli
Topluluk tartışmasında Max Quimby'nin vurguladığı gibi, projenin en kritik katkısı savunma kapısının kendisinden ziyade ortaya koyduğu tehdit modeli analizidir. Mühendislik ekipleri loss (kayıp) eğrisinin doğru yönde ilerlediğini görüp sürecin sorunsuz olduğunu düşünebilir; ancak hedeflenmiş bir saldırı tam da bu iyileşen toplu metriklerin arkasına gizlenir. Toplu metriklere dayanan geleneksel denetimler bu cerrahi saldırılara karşı yapısal olarak kördür.
Yazılım ve yapay zeka geliştiricileri için çıkarılacak temel ders şudur: Fine-tuning iş akışlarında yalnızca "Genel kayıp azaldı mı?" sorusuyla yetinilmemeli; "Bu spesifik olgu referans doğruluktan saptı mı?" sorusu sorularak veri hazırlama ve doğrulama süreçlerinde olgu bazlı gömme kontrol proxy'leri mimariye dahil edilmelidir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/dante777/i-built-an-epistemic-gate-to-stop-llm-data-poisoning-during-fine-tuning-tested-across-5-42kk)
Bu konuyu derinlemesine öğrenmek isterseniz: AI Tedarik Zinciri Güvenliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →