Makine Öğrenmesi·2 dk okuma·

FlowBalance: Doğrulayıcı Tabanlı ve Politika-İçi Akıl Yürütmeyle Kendi Kendini Geliştirme

Paylaş
Makine ÖğrenmesiEdumints Blog

Giriş ve Problem Tanımı

Akıl yürütme (reasoning) modelleri kendi politika-içi (on-policy) deneyimlerinden öğrenerek muhakeme yeteneklerini geliştirebilirler; ancak bu iç döngü son derece kırılgandır. Uç nokta doğrulayıcıları (terminal verifiers) güvenilir sonuçlar üretse de seyrek (sparse) bir denetim sağlar. Diğer yandan, modelin kendi ürettiği yoğun rehberlik, sahte bir özgüveni pekiştirebilir ya da öğrenmeyi dar bir çözüm moduna aşırı odaklayarak modelin keşif yeteneğini köreltebilir.

FlowBalance: Doğrulayıcı Tabanlı Öz-Rehberlik

FlowBalance, eksiksiz yanıtlar üzerinde normalize edilmiş bir olasılık dağılımı öğrenen, doğrulayıcı tabanlı bir kendini geliştirme yöntemidir. Yaklaşım, yörünge dengesi (trajectory balance) üzerinden sonuç odaklı kalibre edilmiş bir öz-rehberlik mekanizması sunar:

  • Yörünge Düzeyinde Öz-Rehberlik: Her politika-içi yörünge için, aynı politikanın dondurulmuş eğitim-zamanı görünümü ayrıcalıklı bağlamı (privileged context) kullanarak belirteç düzeyinde log-olasılık kazanımları üretir ve bunlar yörünge düzeyinde bir öz-rehberlik puanında toplanır.
  • Grup Avantajı ile Kalibrasyon: FlowBalance bu puanı doğrulayıcıdan türetilen grup avantajı ile kalibre eder: Rehberlik; pozitif avantajlı yörüngelerde korunur, negatif avantajlı yörüngelerde tersine çevrilir ve rollout grubu herhangi bir sonuç tercihi sunmadığında devre dışı bırakılır.
  • Yörünge Dengesi ve Enerji Modellemesi: Ortaya çıkan enerji referans politikayı üstel olarak yeniden ağırlıklandırır. Profillemiş yörünge dengesi, rollout grubu başına yalnızca tek bir log-bölümleme tahminiyle hedefi optimize eder; böylece belirteç düzeyinde ayrı bir taklit kaybına (imitation loss) ihtiyaç kalmaz.

Teorik Çerçeve ve Analiz

Model mimarisi üzerinde yürütülen teorik analizler dört temel güvence sağlar:

  • Grup İçi Kontrastın Korunması: Rollout gruplarındaki göreceli kalite farklarının kaybolmasını engeller.
  • Minimum Değişimli Ters-KL Karakterizasyonu: Politikanın referans dağılımdan kontrolsüz sapmasını sınırlar.
  • Monoton Doğrulayıcı Kontrolü: Hedef ödülün doğrulayıcı tarafından tutarlı biçimde yönlendirilmesini temin eder.
  • Yanlış-Pozitif Düzeltmesi: Reddedilen yanıtlardaki yanıltıcı öz-rehberlik sinyallerine karşı kesin bir düzeltme sunar.

Deneysel Bulgular ve Pratik Çıkarımlar

Matematiksel akıl yürütme kıyaslamalarında FlowBalance; hem Qwen3-4B hem de Qwen3-8B üzerinde FlowRL taban çizgisine kıyasla ortalama başarımı artırmış, eğitim hızını ve kararlılığını yükseltmiştir. Doğrudan OPSD yönteminde yaşanan yanıt uzunluğu çöküşünü (length collapse) engellemiş ve AIME24 testlerinde daha yüksek doğru strateji çeşitliliği sergilemiştir.

Yazılım ve AI Geliştiricileri İçin Çıkarımlar:

  • Kendi Kendini Eğitme (Self-Training) Stabilitesi: Seyrek ödülleri grup avantajıyla kalibre etmek, pekiştirmeli öğrenme süreçlerindeki mod çöküşünü önlemek için kritik bir tasarım desenidir.
  • Hesaplama Verimliliği: Belirteç başına taklit kaybı yerine yörünge düzeyinde optimizasyon kurmak, eğitim maliyetini düşürürken modelin akıl yürütme esnekliğini korur.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.03241)


Bu konuyu derinlemesine öğrenmek isterseniz: İleri Akıl Yürütme Teknikleri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →