QwenGyre: Çok Uzun Ufuklu Ajanların Eğitimi İçin Esnek Pekiştirmeli Öğrenme Çerçevesi
İçindekiler
Büyük dil modeli (LLM) tabanlı otonom ajanlar, günümüzde tek bir çalıştırmanın saatler sürdüğü, çevreyle yüzlerce model-ortam etkileşimi gerektirdiği ve deneme (rollout) başına yaklaşık 1 milyon tokene ulaştığı aşırı uzun ufuklu (xlong-horizon) görevleri giderek daha fazla üstlenmektedir. Yazılım depolarının uçtan uca inşası ve karmaşık hata ayıklama süreçleri gibi bu uzun soluklu yürütmelere çevrim içi pekiştirmeli öğrenme (online RL) uygulamak, geleneksel eğitim altyapılarında iki temel zorluğu beraberinde getirmektedir:
Karşılaşılan İki Temel Zorluk
- 1. Şiddetli Çalışma Zamanı Varyansı ve GPU Boşta Kalması: Ajanların görevleri tamamlama süreleri arasındaki yüksek değişkenlik ve uzun süren dağıtım gecikmeleri, geleneksel eğitim mimarilerinde GPU kaynaklarının devasa ölçüde atıl kalmasına yol açmaktadır.
- 2. Karmaşık Doğrusal Olmayan Dallanma ve Yörünge Fazlalığı: Ajanların problem çözerken keşfettiği karmaşık karar ağaçları ve dallanmalar, eğitim veri setinde yüksek oranda yörünge fazlalığı (redundancy) oluşturarak eğitim verimliliğini ciddi şekilde felç etmektedir.
QwenGyre: Uçtan Uca Esnek Çözüm Mimarisi
Bu darboğazları aşmak amacıyla geliştirilen uçtan uca QwenGyre çerçevesi, eğitim maliyetlerini sınırlar ve donanım kullanımını maksimize eder:
- Dinamik ve Kesintisiz GPU Tahsisi: QwenGyre, devam eden canlı çalıştırmaları hiçbir şekilde kesintiye uğratmadan GPU kaynaklarını dağıtım (rollout) ve model eğitimi aşamaları arasında esnek ve dinamik bir biçimde yeniden paylaştırır.
- Gelişmiş Yörünge İşleyici (Trajectory Processor): Ajanın dallanma geçmişlerini yeniden yapılandırır, kısmi ilerlemeleri puanlar ve yinelenen yolları tekilleştirerek (deduplication) gereksiz adımları ayıklar; böylece eğitim maliyetlerini kesin sınırlara bağlar.
Başarı Metrikleri ve Deneysel Sonuçlar
QwenGyre, deneme başına 700 bin tokenlik yüklerle amiral gemisi Qwen 3.8 2.4T modeli üzerinde ölçeklendirilmiştir:
- Yazılım mühendisliği kıyaslaması olan NL2RepoBench üzerinde yalnızca 48 adımda mutlak %6.0 kazanç sağlayarak başarı oranını %52.5'ten %58.5'e çıkarmıştır.
- Farklı alanlardaki çeşitli eğitim veri setlerinde yürütülen kapsamlı değerlendirmelerde, klasik Colocate yaklaşımına göre 1.85 kata, Async mimarisine göre ise 1.78 kata varan hızlanma sağlamıştır.
Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
Yapay zeka mühendisleri ve modern yazılım geliştiriciler için bu çalışma üç önemli pratik çıkarım sunmaktadır:
- Dinamik Altyapı Yönetimi: Saatler süren çok adımlı ajan süreçlerinde statik GPU tahsisi devasa maliyet israfına neden olur. Üretim ortamlarında eğitim ve çıkarım kaynaklarını dinamik orkestre etmek kritik bir gerekliliktir.
- Yörünge Temizliği ve Veri Kalitesi: Karar ağaçlarındaki çıkmaz sokakları ayıklamak ve kısmi ilerlemeleri ödüllendirmek, ajanların sadece kaliteli mantık yürütme adımlarından öğrenmesini sağlayarak model yakınsamasını hızlandırır.
- Gerçek Dünya Repo Görevleri: NL2RepoBench sonuçları, uzun bağlamlı ve esnek RL tekniklerinin otonom yazılım geliştirme ajanlarını deneysel aşamadan kurumsal üretim seviyesine taşımada vazgeçilmez olduğunu kanıtlamaktadır.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.33848)
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →