DRACO: Uzun Ufuklu Ajan Eğitiminde Dinamik Rubriklerle İnce Taneli Kredi Ataması
İçindekiler
Doğrulayıcısız Uzun Ufuklu Görevler ve Kredi Atama Sorunu
Doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR), görev bünyesinde programatik bir kontrol mekanizması bulunduğunda oldukça başarılı çalışır; ancak uzun ufuklu (long-horizon) otonom ajan senaryolarının çoğunda bu tür zemin gerçeklik (ground-truth) başarı sinyalleri bulunmaz. "Çıktı-körü" (outcome-blind) olarak adlandırılan bu ortamlarda ödül sinyali sağlamak için çok kriterli rubrikler yaygın olarak kullanılır. Ne var ki, her yörünge (trajectory) için yalnızca tek bir skaler skor üretmek, onlarca adımdan oluşan zincirleme eylemlerde kredi atama (credit assignment) problemini çözmek için oldukça zayıf ve gürültülü bir sinyaldir.
DRACO: Dinamik Rubriklerle Avantaj Dağıtımı
Bu sorunu çözmek amacıyla DRACO (Distributing Rubric-based Advantage for Credit Optimization) yöntemi geliştirilmiştir. DRACO'nun çalışma prensibi şu temel adımlara dayanır:
- Dinamik Rubrik Üretimi: Ajan politikasının eğitim süresince evrilen yeteneklerini yakalamak adına değerlendirme rubrikleri eğitim esnasında dinamik olarak oluşturulur.
- Yörünge Başına Tek Skorlama: Tamamlanan her yörünge için belirlenen bu rubrikler üzerinden tek seferlik bir değerlendirme puanı verilir.
- Adım Düzeyinde Dağıtım: Elde edilen yargı, ilgili rubrik kriterlerinden sorumlu spesifik adımlara dağıtılarak GRPO (Group Relative Policy Optimization) algoritması için her adıma özgü (per-step) farklılaştırılmış avantaj değerleri elde edilir.
- Kapalı Formda Çözüm: Bu yeniden dağıtım tamamen kapalı formda (closed-form) gerçekleşir ve sisteme eğitilmesi gereken fazladan bir atıf modülü eklemez.
Kıyaslama ve Başarım Sonuçları
DRACO, doğrudan herhangi bir programatik doğrulayıcı kullanmamasına karşın önemli performans artışları kaydetmiştir:
- AppWorld Kıyaslaması: Temel modelin 15.9 puan, seyrek zemin gerçeklik ödülüyle eğitilen GRPO'nun ise 5.3 puan üzerinde başarı sergilemiştir.
- Tau-Bench (Alan Dışı Değerlendirme): Öncü bir hakem model (frontier judge) olmadan dahi temel modele göre 5.3 puan kazanım sağlamış; hem zemin gerçeklik ödüllü eğitimi hem de diğer rubrik tabanlı yaklaşımları geride bırakmıştır.
- Açık Kaynak Kod: Çalışmanın kaynak kodları açık olarak
https://github.com/IBM/dracoadresinde sunulmuştur.
Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
- Skaler Skor Tuzağından Kaçının: Multi-step ve araç çağıran (tool calling) ajan mimarilerinde tüm akışı tek bir uçtan uca başarı skoruyla optimize etmek zordur; kritik adımların tek tek kredilendirilmesi gerekir.
- Dinamik Değerlendirme Tasarımı: Gelişen ajan sistemlerinde statik doğrulama metrikleri hızla yetersiz kalır; model yeteneğine göre güncellenen dinamik kriterler oluşturmak güvenilirliği doğrudan artırır.
- Hafif ve Kararlı Mimari: Atıf mekanizmaları için ek modeller eğitmek yerine kapalı form analitik çözümler tercih etmek, üretim aşamasında hem gecikmeyi hem de operasyonel karmaşıklığı önler.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.04094)
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →