LLM·3 dk okuma·

Kimin İçin Güvenlik? Tüm Konuyu Değil, Doğru Alt Kümeyi Reddetmek

Paylaş
LLMEdumints Blog

Yapay zeka güvenlik hizalaması (safety alignment) çalışmalarının büyük bir kısmı, zararı belirli bir konunun bütününe ait genel bir özellik olarak ele almaktadır. Bu yaklaşıma göre bir istem (prompt); silahlar, dolandırıcılık veya kendine zarar verme gibi genel bir kategoriye girdiği anda doğrudan "güvensiz" olarak değerlendirilir. LlamaGuard-3 gibi yaygın koruma modelleri tam olarak bu konu düzeyindeki taksonomileri kodlar. Ancak bu durum, modellerin güvenli istemleri sırf tehlikeli görünen tek bir kelime içerdikleri için reddettiği aşırı ret (over-refusal) hata modunu doğurur. XSTest ve OR-Bench gibi kıyaslama araçları bu sorunu ölçerken, ret kalibrasyonu çalışmaları bu oranı aşağı çekmeye odaklanır.

Gerçek Dünya Dağıtımları ve Konu Düzeyinin Yetersizliği

Gerçek dünya dağıtımları (deployments) konu düzeyindeki bu basitleştirmeye nadiren uyar. Aynı temel model; genel bir asistan, bir eğitim ürünü, kurumsal bir sistem ya da kamu sektörü hizmeti için özelleştirilebilir ve her senaryo aynı konu içinde farklı sınırlara ihtiyaç duyar:

  • Farklı Dağıtım İhtiyaçları: Örneğin bir vatandaşlık eğitimi botu ile bir kamu sektörü asistanı aynı modeli paylaşabilir ancak siyaset konusunda zıt davranışlar sergilemelidir. İkisi de seçimlerle ilgili olgusal soruları yanıtlamalıdır; fakat kamu asistanı hedefli siyasi manipülasyon metinleri yazma talebini kesinlikle reddetmelidir.
  • Konu Düzeyi Koruyucuların Eksikliği: Konu düzeyindeki bir güvenlik mekanizması bu ayrımı yansıtamaz. Örneğin LlamaGuard-3 seçimleri yalnızca "seçim sistemleri ve süreçleri hakkında olgusal olarak yanlış bilgi" kapsamında ele alır. Bu yaklaşım manipülasyon ve iknayı dışarıda bırakırken, modelin yanıtlamaya devam etmesi gereken olgusal istemlerin de engellenmesine yol açabilir.

Dar Sınır Güvenliği (Narrow-Boundary Safety)

Multiverse Computing CAI ekibinin çalışması doğrudan bu daraltılmış problemi inceler: Asıl mesele bir konunun tamamının reddedilip reddedilmeyeceği değil; o konunun hangi alt kümesinin kurum politikasıyla uyumsuz olduğu ve modelin bu sınıra göre nasıl eğitilip ölçüleceğidir.

  • Zararlı Alt Küme ve Zararsız Tamamlayıcı: Araştırmada tüm siyasi istemlerden oluşan bir konu evreni tanımlanır. Politika, tüm siyaseti reddetmek yerine yalnızca manipülasyon içeren zararlı alt kümeyi reddetmeyi ve zararsız tamamlayıcıyı (benign complement) yanıtlamayı hedefler.
  • Keskin Basamak İkilemi: İdeal davranış keskin bir basamaktır (sharp step): zararlı küme içinde reddet, konunun geri kalanında yanıtla. Ancak eğitilen modeller asla bu keskinliği öğrenemez; yalnızca hedefi yaklaşık olarak yakalayan bir ret olasılığı öğrenir. Çapraz entropi (cross-entropy) eğitimi zararlı bölgede reddi artırırken, ret davranışını sınırın dışındaki zararsız alana da taşırabilir.
  • İkili İstem Testleri (Paired Prompts): Bu sınır; aynı konu çıpasını paylaşan ve yalnızca niyet bakımından ayrışan istem çiftleriyle somutlaştırılır. Siyasi alanda meşru olgusal bilgi talepleri ile zararlı manipülatif ikna arasındaki sınır bu yöntemle test edilir.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Kaba Filtrelerden Kaçınma: Güvenlik katmanında tüm bir kategoriyi toptan engellemek yüksek yanlış pozitif (false positive) oranına yol açar. Geliştiriciler, kaba guardrail sınıflandırıcıları yerine niyet odaklı alt küme filtreleri kurgulamalıdır.
  • Sınır Farkındalıklı Değerlendirme: Güvenlik testlerinde modelin yalnızca zararlı istemleri reddetmesi değil, ret kalibrasyonunun sınır dışına taşarak meşru istekleri engellemediği de ikili test veri setleriyle (paired prompts) sürekli doğrulanmalıdır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/blog/MultiverseComputingCAI/safety-for-whom)


Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →