---
title: "DRACO: Uzun Ufuklu Ajan Eğitiminde Dinamik Rubriklerle İnce Taneli Kredi Ataması"
url: https://blog.edumints.com/draco-uzun-ufuklu-ajan-egitiminde-dinamik-rubriklerle-ince-t-747aeqpm
category: "Yazılım"
date: 2026-09-06T07:12:06.586Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.04094
---

# DRACO: Uzun Ufuklu Ajan Eğitiminde Dinamik Rubriklerle İnce Taneli Kredi Ataması

## Doğrulayıcısız Uzun Ufuklu Görevler ve Kredi Atama Sorunu
Doğrulanabilir ödüllerle pekiştirmeli öğrenme (**RLVR**), görev bünyesinde programatik bir kontrol mekanizması bulunduğunda oldukça başarılı çalışır; ancak uzun ufuklu (**long-horizon**) otonom ajan senaryolarının çoğunda bu tür zemin gerçeklik (**ground-truth**) başarı sinyalleri bulunmaz. "Çıktı-körü" (**outcome-blind**) olarak adlandırılan bu ortamlarda ödül sinyali sağlamak için çok kriterli rubrikler yaygın olarak kullanılır. Ne var ki, her yörünge (**trajectory**) için yalnızca tek bir skaler skor üretmek, onlarca adımdan oluşan zincirleme eylemlerde kredi atama (**credit assignment**) problemini çözmek için oldukça zayıf ve gürültülü bir sinyaldir.

## DRACO: Dinamik Rubriklerle Avantaj Dağıtımı
Bu sorunu çözmek amacıyla **DRACO** (*Distributing Rubric-based Advantage for Credit Optimization*) yöntemi geliştirilmiştir. DRACO'nun çalışma prensibi şu temel adımlara dayanır:
- **Dinamik Rubrik Üretimi:** Ajan politikasının eğitim süresince evrilen yeteneklerini yakalamak adına değerlendirme rubrikleri eğitim esnasında dinamik olarak oluşturulur.
- **Yörünge Başına Tek Skorlama:** Tamamlanan her yörünge için belirlenen bu rubrikler üzerinden tek seferlik bir değerlendirme puanı verilir.
- **Adım Düzeyinde Dağıtım:** Elde edilen yargı, ilgili rubrik kriterlerinden sorumlu spesifik adımlara dağıtılarak **GRPO** (Group Relative Policy Optimization) algoritması için her adıma özgü (**per-step**) farklılaştırılmış avantaj değerleri elde edilir.
- **Kapalı Formda Çözüm:** Bu yeniden dağıtım tamamen kapalı formda (**closed-form**) gerçekleşir ve sisteme eğitilmesi gereken fazladan bir atıf modülü eklemez.

## Kıyaslama ve Başarım Sonuçları
DRACO, doğrudan herhangi bir programatik doğrulayıcı kullanmamasına karşın önemli performans artışları kaydetmiştir:
- **AppWorld Kıyaslaması:** Temel modelin **15.9 puan**, seyrek zemin gerçeklik ödülüyle eğitilen GRPO'nun ise **5.3 puan** üzerinde başarı sergilemiştir.
- **Tau-Bench (Alan Dışı Değerlendirme):** Öncü bir hakem model (**frontier judge**) olmadan dahi temel modele göre **5.3 puan** kazanım sağlamış; hem zemin gerçeklik ödüllü eğitimi hem de diğer rubrik tabanlı yaklaşımları geride bırakmıştır.
- **Açık Kaynak Kod:** Çalışmanın kaynak kodları açık olarak `https://github.com/IBM/draco` adresinde sunulmuştur.

## Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
- **Skaler Skor Tuzağından Kaçının:** Multi-step ve araç çağıran (**tool calling**) ajan mimarilerinde tüm akışı tek bir uçtan uca başarı skoruyla optimize etmek zordur; kritik adımların tek tek kredilendirilmesi gerekir.
- **Dinamik Değerlendirme Tasarımı:** Gelişen ajan sistemlerinde statik doğrulama metrikleri hızla yetersiz kalır; model yeteneğine göre güncellenen dinamik kriterler oluşturmak güvenilirliği doğrudan artırır.
- **Hafif ve Kararlı Mimari:** Atıf mekanizmaları için ek modeller eğitmek yerine kapalı form analitik çözümler tercih etmek, üretim aşamasında hem gecikmeyi hem de operasyonel karmaşıklığı önler.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.04094)](https://huggingface.co/papers/2609.04094)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Production'da Agent Güvenilirliği](https://edumints.com/kesfet/production-agent-orchestration-crewai-ve-autogen-i-u3cu) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.04094)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/draco-uzun-ufuklu-ajan-egitiminde-dinamik-rubriklerle-ince-t-747aeqpm
