LLM·2 dk okuma·

LLM'lerde Tanıma ve Reddetme Uyumsuzluğu: Modeller İmkânsız Soruları Neden Israrla Yanıtlar?

Paylaş
LLMEdumints Blog

İmkânsız Sorular ve Güvenli Halüsinasyon Problemi

Büyük dil modelleri (LLM'ler); cot(-540°) hesaplaması veya Python'da (1).startswith("1") gibi yapısal olarak çözümü imkânsız olan sorularla karşılaştıklarında cevap vermekten kaçınmak yerine genellikle yanlış bir özgüvenle yanıt üretirler. Araştırmacılar bu hatanın kaynağını mercek altına alıyor: Model imkânsızlığı temsil mi edemiyor (kodlama hatası), yoksa bu tanıma bilgisini reddetme mekanizmasına mı ulaştıramıyor (yönlendirme hatası)?

Temel Bulgular ve Geometrik Ayrışma

1.7B ile 70B parametre aralığındaki talimat uyarlı (instruction-tuned) modeller üzerinde yapılan araştırmada şu beş kritik bulguya ulaşılmıştır:

  • Gizli Durumlarda Doğrusal Tanıma Yönü: Modellerin gizli katmanlarında, yanıtlanabilir istemler ile yapısal olarak imkânsız matematik ve kod istemlerini net biçimde ayıran tek bir doğrusal yön bulunmaktadır. Bu da modellerin henüz metin üretim safhasına geçmeden önce sorunun imkânsız olduğunu içsel olarak temsil ettiğini gösterir.
  • Güvenlik Reddi ile Ortogonal Geometri: Bu imkânsızlığı tanıma doğrultusu, zararlı içeriklerin engellenmesinde kullanılan standart güvenlik-reddetme (safety-refusal) yönüyle neredeyse tamamen diktir (ortogonal). Model güvenlik reddi mekanizması ile imkânsızlık algısını birbiriyle eşleştiremez.
  • Alana Özgü Geçersizlik Yönü: Davranışsal olarak tanımlanan alan-içi geçersizlik farkındalığı yönü, tanıma yönüne daha yakın olsa da onunla yalnızca kısmen hizalanır ve güvenlik reddi yönüne yine neredeyse ortogonal kalmayı sürdürür.
  • Üretim Anında Aktivasyon Yönlendirme: Çıkarım sırasında tanıma yönü boyunca yapılan aktivasyon yönlendirmesi (steering), matematik ve kod testlerindeki geçersizlik davranışını doza duyarlı ve çift yönlü olarak değiştirirken, rastgele yönler hiçbir etki göstermez.
  • Ön Eğitimden Gelen Geometri: Temel (base) ve talimatlı modeller arasındaki karşılaştırmalar, düşük kosinüs benzerliğine dayalı bu geometrik ayrışmanın talimat ince ayarında değil, doğrudan ön eğitim aşamasının sonunda zaten mevcut olduğunu ortaya koyar.

Sonuç: Kodlama Değil, Yönlendirme Hatası

Modellerin yapısal olarak imkânsız sorulara iddialı yanıtlar vermesi bir anlama/temsil eksikliğinden ziyade bir yönlendirme (routing) hatasıdır. Modelin iç yapısında kullanılabilir bir "kabul edilebilir yanıt yok" sinyali kesinlikle mevcuttur; ancak güvenlik-reddetme yolu bu sinyali tüketip yanıtı reddedecek biçimde hizalanmamıştır.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Güvenlik Hizalamasına Bel Bağlamayın: RLHF veya standart güvenlik kontrolleri modellerin mantıksal geçersizlikleri reddetmesini sağlamaz; model geçersiz API çağrılarına veya hatalı sözdizimlerine halüsinasyonla yanıt vermeye devam eder.
  • Temsil Mühendisliği (Representation Steering): Modellerin gizli durumlarındaki bu tanıma vektörleri tespit edilerek, üretim esnasında geçersiz istekleri erkenden yakalayan hafif çıkarım-zamanı güvenlik bariyerleri (guardrails) oluşturulabilir.
  • Deterministik Doğrulama Katmanları: Kritik kod ve matematik mimarilerinde LLM'in kendi kendine reddetme kararı vermesine güvenilmemeli; girdi düzeyinde AST analizi, tip kontrolü ve matematiksel sınır testleri deterministik olarak işletilmelidir.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →