Girişte Kilitli, İçeride Açık: RLVR Çözüm Alanını Nerede Daraltıyor?
İçindekiler
RLVR ve Çözüm Uzayının Daralması Problemi
Doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR), büyük dil modellerinde tekil örneklem doğruluğunu (pass@1) önemli ölçüde artırmaktadır. Ancak bu kazanım, politikanın çözüm uzayını daraltarak test anı ölçeklemesinin (test-time scaling; Best-of-N, Majority Voting vb.) getirilerini ciddi biçimde düşürmektedir. Çünkü model, yüksek ödül aldığı tek bir patikaya aşırı odaklanmaktadır. Bu araştırma, akıl yürütme sürecindeki çözüm çeşitliliğinin tam olarak nerede kaybedildiğini sorgulamaktadır: Model geçerli bir çözüm ailesine erişimde mi zorlanıyor, yoksa başlatılan hesaplamayı yürütmede mi başarısız oluyor?
Metodoloji ve Temel Bulgular
Araştırmacılar, çözüm uzayı ilk işlenen sayı ve operatöre göre ayrık giriş ailelerine bölünebilen Countdown görevi üzerinden Qwen2.5-3B (PPO) ve Qwen2.5-3B-Instruct (GRPO) modellerini incelemiştir:
- Çözüm Kapsamının Daralması: Her iki eğitim kurulumunda da çözüm kapsamı %67'ye varan oranda düşmüş; tüm eğitim kontrol noktalarında istikrarlı şekilde çözülebilen problemlerde dahi çözüm çeşitliliği yarı yarıya azalmıştır.
- Girişte Yoğunlaşan Olasılık Kayması: Belirteç (token) başına düşen olasılık değişimleri, ilk aritmetik işlemden önceki başlangıç adımlarında, sonraki derin akıl yürütme adımlarına kıyasla 11 ila 16 kat daha büyüktür.
- Yürütme Potansiyelinin Korunması: Modele yalnızca seçilmemiş alternatif bir giriş ön eki (entrance prefix) sağlandığında, düşük erişimli ailelerdeki tamamlanma oranı 0.018'den 0.212'ye (10 kattan fazla) yükselmiştir. Bu durum, modelin alternatif çözümleri yürütme yeteneğini kaybetmediğini, sadece bu yolları kendi başına başlatamadığını gösterir.
- Giriş Odaklı Müdahaleler: Klasik yönlendirme (surface prompting) teknikleri çeşitliliği geri getirmede başarısız olurken, erken kontrol noktalarıyla son katman parametre enterpolasyonu (ağırlık harmanlama) uygulamak, pass@1 kaybı yaşamadan çözüm kapsamını %37 artırmıştır.
- Mimari ve Pipeline Çıkarımları: Erken adım entropi çöküşü 7B ve 14B modellerde 6 matematik testinde tekrarlanmıştır; ancak bu kaçınılmaz bir kader değildir. Standart SFT taban çizgisi iki kattan fazla kapsamı korurken, aşamalı SFT → DPO → RLVR hatları erken aşama entropisini başarıyla muhafaza etmektedir.
Kısacası; akıl yürütme çeşitliliği odanın içinde değil, doğrudan giriş kapısında kaybedilmektedir.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Çeşitlilik İçin Prefix Enjeksiyonu: Üretim ortamlarında test-time compute veya Best-of-N örneklemesi yaparken sıcaklığı (temperature) artırmak çözüm çeşitliliği sağlamaz. Bunun yerine modelin ilk çıkarım adımına farklı başlangıç prefix'leri enjekte ederek alternatif çözüm dallarını tetikleyin.
- Model Enterpolasyonu ile Doğruluk-Çeşitlilik Dengesi: Aşırı özelleşmiş RLVR modellerini erken eğitim kontrol noktalarıyla katman bazlı harmanlayarak, doğruluktan ödün vermeden çözüm uzayı genişliğini koruyun.
- Kademeli Eğitim Pipeline'ı Tercihi: Akıl yürütme ajanları geliştirirken doğrudan RLVR uygulamak yerine, erken entropiyi koruyan aşamalı SFT → DPO → RLVR mimarilerini kurgulayın.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: İleri Akıl Yürütme Teknikleri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →