RetireOPD: Ajan Tabanlı Pekiştirmeli Öğrenme İçin Kendi Kendini Emekliye Ayıran Damıtma
İçindekiler
Çok Turlu Ajanlarda Pekiştirmeli Öğrenme ve Damıtma İhtiyacı
Çok turlu (multi-turn) otonom ajanların pekiştirmeli öğrenme (RL) ile eğitilmesinde en kritik zorluk, ajanın tüm görev yörüngesi (trajectory) boyunca yalnızca tek bir skaler ödül almasıdır. Bu seyrek ödül yapısı, karmaşık karar zincirlerinde hangi adımların doğruluğu getirdiğini ayırt etmeyi zorlaştırır. Bu kısıtı aşmak için, ayrıcalıklı görev becerilerine (privileged task skills) sahip bir öğretmen modelden belirteç (token) seviyesinde yoğun gözetim sağlayan ve bu yetenekleri beceriden yoksun öğrenci modele kazandıran İlke İçi Damıtma (On-Policy Distillation - OPD) yöntemi tercih edilir.
Ajan Görevlerinde İki Temel Kısıt
Ancak bu damıtma kurgusu, ajan tabanlı görevlerde gözlemlenen iki kritik bulgu nedeniyle sekteye uğramaktadır:
- Ayrıcalıklı Bilginin Yetersizliği: Ayrıcalıklı bilgilere erişim, öğretmen modeli her karar noktasında mutlak olarak güvenilir bir rehber yapmaya yetmez.
- Aşama Bağımlı Fayda: Öğretmen gözetiminin sağladığı katma değer eğitim aşamasına göre değişiklik gösterir; eğitimin başında kritik olan rehberlik, ilerleyen safhalarda öğrenciyi sınırlayabilir.
RetireOPD Mimarisi
Bu kısıtları ortadan kaldırmak amacıyla RetireOPD (Self-Retiring On-Policy Distillation) yaklaşımı önerilmiştir:
- İlk olarak, çevre ödülleri kullanılarak optimize edilmiş ve görev becerilerine koşullandırılmış (skill-conditioned) bağımsız bir öğretmen model eğitilir.
- Ardından, herhangi bir ayrıcalıklı becerisi bulunmayan öğrenci model, çevre ödülleri (RL) ve öğretmen rehberliği (OPD) ile eş zamanlı olarak eğitilir.
Adaptif Emeklilik (Adaptive Retirement)
RetireOPD, statik ve önceden tanımlanmış bir damıtma takvimi yerine dinamik bir Adaptif Emeklilik mekanizması uygular:
- Öğrenci ile öğretmen arasındaki çıktı tutarsızlığı (discrepancy) küçülmeyi bıraktığında ve öğrenci, öğretmenin başarı oranının belirlenen hedef kesrine ulaştığında öğretmenini otonom olarak devreden çıkarır.
- Emeklilik gerçekleştikten sonra eğitim süreci, öğretmenin sınırlarına takılmadan yalnızca saf RL optimizasyonu ile devam eder.
Model Başarısı ve Performans Kazanımları
1.5B ile 7B parametre aralığındaki Qwen2.5 modelleri üzerinde yapılan deneylerde RetireOPD şu sonuçları vermiştir:
- ALFWorld ortamında temel RL yöntemine kıyasla başarı oranını %14.1 ile %18.8 arasında artırmıştır.
- WebShop görevlerinde doğruluk oranını %11.8 ile %19.0 seviyesinde yükseltmiştir.
- Tüm senaryolarda ayrıcalıklı bilgiyle donatılmış kendi öğretmen modelinin dahi üzerine çıkmayı başarmıştır.
Yazılım Geliştirme ve Öğrenme Çıkarımları
- Dinamik Eğitmen Ayrımı: Çok adımlı ajan mimarilerinde statik damıtma zamanlamaları yerine, ajanın gelişimine göre ayrılan dinamik kontrol mekanizmaları uygulanmalıdır.
- Öğretmeni Aşan Küçük Modeller: Doğru zamanlanmış bir bağımsızlaşma stratejisi, küçük parametreli modellerin (SLM) üretimde öğretmen modellerden bile daha esnek ve yüksek başarıya ulaşmasını sağlar.
- Seyrek Ödülden Yoğun Gözetime: Geliştiriciler karar sistemlerinde tek bir nihai ödül yerine token düzeyinde erken rehberlik sağlayıp ardından modeli serbest bırakmalıdır.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.20784)
Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →