LLM·3 dk okuma·

J Uzayından Model Yönlendirme Vektörlerinin (Steering Vectors) Çıkarılması

Paylaş
LLMEdumints Blog

Büyük dil modellerinin (LLM) ara katman aktivasyonlarını deşifre etmek ve modelin ne düşündüğünü veya bir sonraki adımda ne söyleyeceğini öngörmek amacıyla Jacobian (J) uzayı kullanılmaktadır. Bu çalışmanın temel amacı, J lens matrisini tersine çevirerek (inverting), hedeflenen kavramı temsil eden birkaç token üzerinden genel bir aktivasyon yönlendirme vektörü (steering vector) elde edilip edilemeyeceğini test etmektir. Deney sonuçları, J uzayının belirli davranışları temsil eden kavram belirteçlerinden yönlendirme vektörü türetmek için güçlü bir zemin sunduğunu göstermektedir. Bu yöntem, çıktıların tamamen büyük harfle yazılması veya sıra dışı bir üslupla konuşulması gibi basit davranışlarda oldukça başarılı çalışmaktadır. Buna karşın, sadece birkaç kelimeyle doğrudan ifade edilemeyen karmaşık davranışlarda kırılgan kalmakta ve halüsinasyon riskini artırmaktadır.

Kurulum (Setup)

  • Model: Deneylerde açık kaynaklı Qwen3-1.7B modeli kullanılmıştır.
  • J Lens Kaynağı: Neuronpedia tarafından Hugging Face üzerinde paylaşılan hazır J lens matrisinden (neuronpedia/jacobian-lens) yararlanılmıştır.
  • Çalışma Ortamı: Deneylerin tümü yerel olarak bir MacBook üzerinde yürütülmüştür; daha büyük modellerin test edilememesinin temel nedeni bu donanım sınırıdır.
  • Kod Tabanı: Uygulamaya ait kaynak kodlar açık olarak jlens_steer deposunda paylaşılmıştır.

Yönetici Özeti (Executive Summary)

Yeni yöntemi doğrulamak adına ilk olarak çalışan iki temel referans vektör oluşturulmuştur:

  • Büyük Harf Referansı: science-of-finetuning/steering-vecs-qwen3_1_7B deposundan alınan, büyük harfle yanıt vermesi için maliyetli fine-tuning süreçleriyle eğitilmiş modelden çıkarılan yönlendirme vektörü.
  • Reddetme Referansı: Qwen3-1.7B için yayımlanan abliterated (reddetme yönü çıkarılmış) modelin temel modelden çıkarılmasıyla, her katmanın ağırlık değişimi ayrıştırılarak elde edilen yönlendirme vektörü.

Yapılan ön testlerde her iki referans vektörün de modeli hedeflenen davranışa başarıyla yönlendirdiği teyit edilmiştir.

Büyük Harf (All Caps) Davranışını Yönlendirme

J uzayı, L katmanındaki aktivasyonlar ile unembedding matrisi arasında doğrusal bir eşleme sağlar. Yöntemin uygulanış adımları:

  • Sözlükteki büyük ve küçük harf token çiftleri eşleştirilmiştir (örneğin (" AND", " and") veya (" TOWN", " town")).
  • Bu belirteçlere karşılık gelen J lens satırları tersine çevrilerek, ilgili token'ları L katmanında ifade edecek aktivasyon vektörleri ($a_{upper}$ ve $a_{lower}$) elde edilmiştir.
  • Aktivasyon farkı ($a_{upper} - a_{lower}$) PCA ile incelenmiş; fine-tuning ile elde edilen referans vektöre oldukça yakın olduğu ve standart logit lens yaklaşımına kıyasla çok daha yüksek kosinüs benzerliği sergilediği görülmüştür.
  • Tüm çiftlerin aktivasyon farklarının ortalaması alındığında, modelin yanıtlarını başarıyla büyük harfe yönlendirdiği doğrulanmıştır.

Reddetme (Refusal) Davranışını Yönlendirme

Bu yaklaşımın, metin tabanlı basit token çiftlerinin ötesine geçerek model güvenliği ve uyum (alignment) gibi soyut reddetme davranışlarına genellenmesi hedeflenmektedir. Reddetme mekanizmasının J uzayı üzerinden tersine çıkarımı üzerine denemeler sürmektedir.

Yazılım Geliştirme ve Pratik Çıkarımlar

  • Düşük Maliyetli Yönlendirme: Modeli pahalı fine-tuning süreçlerine sokmadan, sadece J lens matris tersi yardımıyla hafif ve hızlı stil yönlendirme vektörleri türetilebilir.
  • Kullanım Sınırları: Soyut iş mantığı ve güvenlik filtrelerinde tek başına yetersiz kalabilir; basit biçimlendirme ve üslup denetimlerinde etkili bir prototipleme aracıdır.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →