DataFlex-RL: Doğrulanabilir Ödüllü Pekiştirmeli Öğrenme (RLVR) Veri Politikaları için Değerlendirme Platformu
İçindekiler
RLVR ve DataFlex-RL Nedir?
Doğrulanabilir ödüllü pekiştirmeli öğrenme (RLVR - Reinforcement Learning with Verifiable Rewards), özellikle matematik, mantık ve fen bilimleri gibi doğruluğu nesnel kurallarla denetlenebilen alanlarda büyük dil modellerinin akıl yürütme yeteneklerini geliştirmek için yaygın olarak kullanılmaktadır. Bu süreçte uygulanan veri politikaları; model tarafından üretilen hangi çıktıların (rollout) eğitimde tutulacağını, bu çıktıların ne derece ağırlıklandırılacağını ve eğitim paketlerine hangi alanların katkı sağlayacağını doğrudan yönetir. DataFlex-RL, bu kritik veri politikası tercihlerini standart ve adil bir GRPO (Group Relative Policy Optimization) reçetesi altında sistematik olarak kıyaslayabilmek için geliştirilmiş açık uçlu bir değerlendirme platformudur.
Temel Deneyler ve Araştırma Bulguları
Platform kapsamında yürütülen kontrollü deneyler, pekiştirmeli öğrenme optimizasyonuna dair çarpıcı sonuçlar ortaya koymaktadır:
- Kapsamlı Deney Mimarisi: Temel deneylerde Qwen2.5-7B-Base modeli temel alınarak; 12 eşleştirilmiş rastgelelik tohumu (seed) ve matematik, mantık ile fen bilimlerini kapsayan 12 farklı kıyaslama testi (benchmark) üzerinde 13 ayrı konfigürasyon değerlendirilmiştir.
- Tekdüze (Uniform) GRPO Başarısı: Karmaşık bir veri politikası eklenmeksizin uygulanan standart tekdüze GRPO eğitimi, eğitilmemiş baz modele kıyasla alan dengeli ortalama doğruluk oranını 7,76 yüzde puan artırarak güçlü bir baz performans sergilemiştir.
- Karmaşık Seçim ve Ağırlıklandırmanın Sınırları: Test edilen sekiz rollout seçimi veya yeniden ağırlıklandırma yönteminin hiçbiri, tekdüze örneklemeye kıyasla sıfırı dışlayan eşleştirilmiş %95 güven aralığına ulaşamamıştır. Benzer şekilde, üç adaptif karışım yönteminden hiçbiri sabit eşit karışıma kıyasla üstünlük kuramamıştır.
- Model Mimarisi Genellemesi: Llama-3.1-8B-Base modeliyle yürütülen düzeltilmiş 12-seed'li genişletme deneyleri, ek yöntemleri kontrollerle aynı puan ölçeğine yerleştirse de ortalama başarı bakımından tutarlı bir kazanan ortaya koyamamıştır.
- Değerlendirme Duyarlılığı (Evaluation Sensitivity): Dokuz farklı Qwen2.5-7B-Instruct çalıştırması; mantık testlerini hariç tutan ve beş matematik testi ile GPQA-Diamond'dan oluşan 6'lı özet kümesi ile 12'li dengeli özet kümesi karşılaştırılarak yeniden puanlanmıştır.
- Sıralama Sapması ve Negatif Korelasyon: Mantık testlerinin dışlandığı 6'lı matematik ağırlıklı özet ile 12'li dengeli özet karşılaştırıldığında model başarı sıralamalarının -0,33 korelasyon katsayısı ile negatif ilişkili olduğu görülmüştür; buna karşın 12 testin tamamını koruyan özetler büyük ölçüde örtüşmektedir.
- Temel Araştırma Çıkarımı: İncelenen kontrollü eğitim koşullarında veri politikasını değiştirmek eğitim sürecini ölçülebilir biçimde etkilemekte; fakat tekdüze eğitime göre tekrarlanabilir ve istatistiksel olarak anlamlı bir kazanım sağlamamaktadır.
Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
- Basitlik Prensibi: Model ince ayar ve RLVR süreçlerinde karmaşık dinamik filtreleme ve ağırlıklandırma boru hatları yerine, basit ve tekdüze veri örneklemesi öncelikli baz çizgi (baseline) olarak benimsenmelidir.
- Test Kümelerinde Alan Dengesi: Değerlendirme süreçlerinde belirli alanları dışarıda bırakmak model sıralamalarını tamamen tersine çevirebilir. Sağlıklı bir model seçimi için alan dengeli ve geniş test kümeleri kullanılmalıdır.
- İstatistiksel Doğrulama ve Tohum Çeşitliliği: Çoklu tohum (seed) ve güven aralıkları kullanılmadan yapılan değerlendirmeler yanıltıcı optimizasyon kararlarına yol açabilir; bu nedenle model testlerinde istatistiksel titizlik şarttır.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.06107)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →