LLM·3 dk okuma·

On-Policy mi, Off-Policy mi? Model Damıtma Dinamiklerinin Sistematik Analizi

Paylaş
LLMEdumints Blog

Giriş ve Problem Tanımı

Yapay zeka modellerinin eğitiminde on-policy (modelin kendi ürettiği verilerle eğitilmesi) yaklaşımının; katastrofik unutmayı azalttığı, daha seyrek parametre güncellemeleri sağladığı ve genelleme yeteneğini artırdığı sıklıkla savunulur. Ancak denetimli ince ayar (SFT) ile pekiştirmeli öğrenme (RL) yöntemlerini kıyaslayan mevcut çalışmalar birçok faktörü aynı anda değiştirdiği için, rollout (çıktı üretim) politikasının bağımsız katkısını izole etmek oldukça zordur.

Kontrollü Deney Ortamı ve Metodoloji

Araştırmacılar bu belirsizliği gidermek amacıyla, güçlü bir modelden zayıf bir modele (strong-to-weak distillation) aktarım yapılan kontrollü bir damıtma kurgusu tasarlamıştır. Llama-3 ve Qwen-2.5 model aileleri üzerinde; bilimsel, tıbbi ve aritmetik alanlardaki akıl yürütme görevlerinde şu üç unsur bağımsız olarak test edilmiştir:

  • Rollout Politikası: Öğrencinin ürettiği on-policy veriler ile öğretmenin ürettiği off-policy veriler ve bu iki uç arasındaki spektrum karşılaştırılmıştır.
  • Token Düzeyinde KL Yönü: Forward KL (ileri yönlü) ve Reverse KL (ters yönlü) diverjans hedefleri değerlendirilmiştir.
  • Öğrenme Oranı (Learning Rate): Unutma eğilimi ve parametre güncelleme dinamikleri farklı öğrenme oranlarında ölçülmüştür.

Damıtma Dinamikleri ve Temel Bulgular

Yapılan analizler, damıtma dinamiklerinde rollout politikasının sanıldığı gibi merkezi bir rol üstlenmediğini ortaya koymaktadır:

  • KL Yönü Performansı Şekillendirir: Görev performansı ve çıktı kapsamı üzerinde en belirgin etkiyi token düzeyindeki KL yönü belirler. Forward KL, rollout politikasındaki değişikliklere karşı son derece dirençli ve kararlıdır. Buna karşın Reverse KL, politikalara karşı çok daha duyarlıdır ve öğrencinin kendi ürettiği rollout verilerini belirgin şekilde tercih eder.
  • Öğrenme Oranı Unutmayı Yönetir: Katastrofik unutma ve parametre güncellemelerinin seyreklik düzeyi, rollout politikasından ziyade doğrudan öğrenme oranı tarafından kontrol edilmektedir.
  • Aritmetik Genelleme ve RLVR Sınırları: On-policy veriler, Countdown gibi zorlu aritmetik görevlerin genelleştirilmesinde her iki KL yönünde de avantaj sağlasa da bu kazanım sonraki RLVR (Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme) aşamalarında kalıcı olmamaktadır.
  • Sonuçların Sağlamlığı: Gradyan kırpmanın kaldırılması, örneklenmiş KL tahminleyicilerinin kullanılması ve daha uzun akıl yürütme zincirleri içeren görevlerde de bu temel çıkarımlar geçerliliğini korumaktadır.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Maliyetli Altyapılardan Kaçının: On-policy veri üretimi yüksek çıkarım maliyeti gerektirir. Modelinizi Forward KL ile eğitiyorsanız, statik ve off-policy veri setleriyle yüksek performanslı ve düşük maliyetli eğitim boru hatları kurabilirsiniz.
  • Hedef Fonksiyonuna Göre Veri Belirleyin: Reverse KL tabanlı bir damıtma mimarisi kullanıyorsanız, öğrenci modelin kendi üretimlerini sisteme dahil eden on-policy döngüler oluşturmalısınız.
  • Hiperparametre Optimizasyonuna Öncelik Verin: Modelin unutma eğilimini azaltmak için karmaşık rollout stratejileri geliştirmek yerine öğrenme oranı ve gradyan dinamiklerini optimize etmeye odaklanın.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.35259)


Bu konuyu derinlemesine öğrenmek isterseniz: Axolotl ve torchtune ile Pratik Çok-GPU Fine-Tuning modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →