MoE Modellerinde Pekiştirmeli Öğrenme İçin Uzman Uzayı Keşfi (ESRL)
İçindekiler
Giriş ve Mevcut Zorluklar
Pekiştirmeli öğrenme (RL), büyük dil modellerinin (LLM) eğitim sonrası (post-training) aşamasının en kritik bileşenlerinden biri haline gelmiştir. Uzmanlar Karması (Mixture-of-Experts - MoE) mimarilerine yönelik RL alanındaki son gelişmeler çoğunlukla optimizasyon kararlılığını sağlamaya ve eğitim verimliliğini artırmaya odaklanmış, uzman seçim (routing) mekanizmasını ise değişmez sabit bir yapı olarak ele almıştır. Oysa yönlendirme katmanı, modelin nihai çıktı dağılımını belirleyen seyrek hesaplama yollarını doğrudan tayin eder. Bu nedenle uzman seçimi, pekiştirmeli öğrenmede rollout çeşitliliğini (rollout diversity) artırmak adına henüz tam olarak yararlanılmamış güçlü bir keşif kaynağı sunar.
Yapılan deneysel analizler, uzman yönlendirmesini pertürbe etmenin (küçük sapmalar eklemenin), tıpkı çıkarım sırasında kod çözme sıcaklığını (decoding temperature) artırmaya benzer şekilde model çıktısını çeşitlendirdiğini göstermektedir. Ancak yönlendirme katmanına doğrudan ve kontrolsüz müdahale etmek, alakasız veya yetersiz uzmanları tetikleyerek rollout kalitesini ciddi biçimde düşürmektedir.
ESRL: Mimariye Duyarlı Uzman Keşfi
Bu gözlemlerden hareketle araştırmacılar, MoE modellerinin uzman yönlendirme uzayını bilinçli ve kontrollü bir şekilde keşfeden mimariye duyarlı ESRL (Expert-Space Exploration Reinforcement Learning) çerçevesini geliştirmiştir. ESRL üç temel mekanizma üzerine kuruludur:
- Çapa Uzmanlar ve Aday Havuzu: Modelin yüksek güvenle seçtiği uzmanları "çapa" (anchor) olarak korur; stokastik yönlendirmeyi yalnızca makul bir aday havuzuyla sınırlandırarak hesaplama yollarının güvenilirliğini muhafaza eder.
- Entropi Tabanlı Adaptasyon: Pertürbasyon şiddetini yönlendirici entropisine (router entropy) göre dinamik olarak uyarlar; böylece aşırı bozulma ve kalite kaybının önüne geçer.
- Yol Kaydı ve Yeniden Oynatma: Pertürbasyonun neden olduğu yönlendirme uyuşmazlığını (routing mismatch) gidermek amacıyla, rollout aşamasında izlenen uzman yollarını kaydeder ve politika optimizasyonu esnasında bu yolları birebir yeniden oynatır (replay).
Performans ve Deneysel Bulgular
Deneysel çalışmalar, ESRL'in ek bir örnekleme veya fazladan hesaplama maliyeti getirmeden; top-K, top-1 ve paylaşımlı uzman yönlendirmesine sahip farklı MoE omurgalarında en yüksek performansı sergilediğini ortaya koymuştur:
- Üstün Başarım: Matematik, fen ve kodlama görevlerinde GRPO gibi güçlü temel yöntemleri geride bırakmıştır.
- Qwen3-30B-A3B Sonuçları: Qwen3-30B-A3B modeli üzerinde uygulandığında ESRL, GRPO yöntemine kıyasla ortalama Pass@1 başarımını 3.2, Pass@8 başarımını ise 4.5 yüzdelik puan artırarak en iyi skora ulaşmıştır.
- Dinamik İçgörüler: Uzman kullanım oranları ve eğitim dinamiklerine dair ayrıntılı analizler, MoE'ye özgü yönlendirme yapısının RL sürecine entegre edilmesinin öğrenme kalitesini nasıl artırdığını kanıtlamaktadır.
Yazılım ve Yapay Zeka Geliştiricileri İçin Pratik Çıkarımlar
- Mimari Düzeyde Keşif: Model çıktılarında çeşitlilik elde etmek için sadece çıkarım sıcaklığına bağlı kalmayın; MoE gibi modüler mimarilerin iç yönlendirme dinamiklerini bir keşif parametresi olarak değerlendirin.
- Güvenli Sınırlar Belirleyin: Stokastik keşiflerde çekirdek yetenekleri (anchor uzmanları) koruyup varyasyonu aday havuzlarıyla kısıtlamak, üretim ve eğitim stabilitesi için kritik bir mühendislik prensibidir.
- Rollout-Optimizasyon Uyumu: Eğitim sırasında stokastik pertürbasyon kullanıldığında veri tutarlılığı sağlamak için izlenen yolların kaydedilip optimizasyonda yeniden oynatılması dağıtım kaymalarını engeller.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →