---
title: "Girişte Kilitli, İçeride Açık: RLVR Çözüm Alanını Nerede Daraltıyor?"
url: https://blog.edumints.com/giriste-kilitli-iceride-acik-rlvr-cozum-alanini-nerede-daral-aqa5w9do
category: "LLM"
date: 2026-09-06T09:08:58.478Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2608.29188
---

# Girişte Kilitli, İçeride Açık: RLVR Çözüm Alanını Nerede Daraltıyor?

## RLVR ve Çözüm Uzayının Daralması Problemi

Doğrulanabilir ödüllerle pekiştirmeli öğrenme (**RLVR**), büyük dil modellerinde tekil örneklem doğruluğunu (**pass@1**) önemli ölçüde artırmaktadır. Ancak bu kazanım, politikanın çözüm uzayını daraltarak test anı ölçeklemesinin (**test-time scaling**; Best-of-N, Majority Voting vb.) getirilerini ciddi biçimde düşürmektedir. Çünkü model, yüksek ödül aldığı tek bir patikaya aşırı odaklanmaktadır. Bu araştırma, akıl yürütme sürecindeki çözüm çeşitliliğinin tam olarak nerede kaybedildiğini sorgulamaktadır: Model geçerli bir çözüm ailesine erişimde mi zorlanıyor, yoksa başlatılan hesaplamayı yürütmede mi başarısız oluyor?

## Metodoloji ve Temel Bulgular

Araştırmacılar, çözüm uzayı ilk işlenen sayı ve operatöre göre ayrık giriş ailelerine bölünebilen Countdown görevi üzerinden Qwen2.5-3B (PPO) ve Qwen2.5-3B-Instruct (GRPO) modellerini incelemiştir:

- **Çözüm Kapsamının Daralması:** Her iki eğitim kurulumunda da çözüm kapsamı **%67'ye varan oranda** düşmüş; tüm eğitim kontrol noktalarında istikrarlı şekilde çözülebilen problemlerde dahi çözüm çeşitliliği yarı yarıya azalmıştır.
- **Girişte Yoğunlaşan Olasılık Kayması:** Belirteç (token) başına düşen olasılık değişimleri, ilk aritmetik işlemden önceki başlangıç adımlarında, sonraki derin akıl yürütme adımlarına kıyasla **11 ila 16 kat daha büyüktür**.
- **Yürütme Potansiyelinin Korunması:** Modele yalnızca seçilmemiş alternatif bir giriş ön eki (**entrance prefix**) sağlandığında, düşük erişimli ailelerdeki tamamlanma oranı **0.018'den 0.212'ye** (10 kattan fazla) yükselmiştir. Bu durum, modelin alternatif çözümleri yürütme yeteneğini kaybetmediğini, sadece bu yolları kendi başına başlatamadığını gösterir.
- **Giriş Odaklı Müdahaleler:** Klasik yönlendirme (**surface prompting**) teknikleri çeşitliliği geri getirmede başarısız olurken, erken kontrol noktalarıyla son katman parametre enterpolasyonu (ağırlık harmanlama) uygulamak, **pass@1 kaybı yaşamadan** çözüm kapsamını **%37** artırmıştır.
- **Mimari ve Pipeline Çıkarımları:** Erken adım entropi çöküşü 7B ve 14B modellerde 6 matematik testinde tekrarlanmıştır; ancak bu kaçınılmaz bir kader değildir. Standart **SFT** taban çizgisi iki kattan fazla kapsamı korurken, aşamalı **SFT → DPO → RLVR** hatları erken aşama entropisini başarıyla muhafaza etmektedir.

Kısacası; akıl yürütme çeşitliliği odanın içinde değil, doğrudan giriş kapısında kaybedilmektedir.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

- **Çeşitlilik İçin Prefix Enjeksiyonu:** Üretim ortamlarında test-time compute veya Best-of-N örneklemesi yaparken sıcaklığı (temperature) artırmak çözüm çeşitliliği sağlamaz. Bunun yerine modelin ilk çıkarım adımına farklı başlangıç prefix'leri enjekte ederek alternatif çözüm dallarını tetikleyin.
- **Model Enterpolasyonu ile Doğruluk-Çeşitlilik Dengesi:** Aşırı özelleşmiş RLVR modellerini erken eğitim kontrol noktalarıyla katman bazlı harmanlayarak, doğruluktan ödün vermeden çözüm uzayı genişliğini koruyun.
- **Kademeli Eğitim Pipeline'ı Tercihi:** Akıl yürütme ajanları geliştirirken doğrudan RLVR uygulamak yerine, erken entropiyi koruyan aşamalı SFT → DPO → RLVR mimarilerini kurgulayın.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2608.29188)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [İleri Akıl Yürütme Teknikleri](https://edumints.com/kesfet/sistematik-prompt-muhendisligi-ve-dspy-ile-program-xpig) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2608.29188)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/giriste-kilitli-iceride-acik-rlvr-cozum-alanini-nerede-daral-aqa5w9do
