IterSynth: Rol Ayrışımlı Yinelemeli Sentez ile Derin Arama Ajanlarını Yeniden Düşünmek
İçindekiler
Derin Arama Ajanları ve ReAct Mimarisinin İki Temel Kısıtı
Derin arama (deep search), büyük dil modeli (LLM) tabanlı otonom ajanların karmaşık kullanıcı sorgularını alt hedeflere ayrıştırmasını, web üzerinde kanıt aramasını ve elde edilen bulgulardan doğrulanmış yanıtlar sentezlemesini gerektirir. Ancak günümüzde yaygın biçimde kullanılan ReAct benzeri ajan mimarileri iki kritik kısıtla karşı karşıyadır:
- Rol Bağımlılığı (Role Coupling): Tek bir model politikasının hem araştırma adımlarını planlama, hem kanıtları değerlendirme hem de nihai sentezi üretme görevlerini aynı anda üstlenmek zorunda kalmasıdır. Bu durum, modelin akıl yürütme kapasitesini zorlar.
- Bağlam Birikimi (Context Accumulation): Çok adımlı araştırma geçmişi genişledikçe arama geçmişinin bağlam penceresinde birikerek gürültü yaratması ve kritik bilgilerin kaybolmasına yol açmasıdır.
IterSynth Paradigması: Ayrık Roller ve Özet Tabanlı Durum Yönetimi
Bu sorunları çözmek amacıyla önerilen IterSynth, rol ayrışımını (role-decoupled) ve özet merkezli durum yönetimini birleştiren yenilikçi bir paradigmadır. Sistem, iki temel rol arasında dinamik ve ardışık bir döngü işletir:
- Planlayıcı (Planner): Bilgi eksikliklerini ve araştırma ihtiyaçlarını analiz ederek hedefe yönelik yeni arama adımlarını belirler.
- Sentezleyici (Synthesizer): Elde edilen kanıtları filtreleyip sürekli gelişen kalıcı bir özet durumuna (summary state) entegre eder.
Planlama ile sentezin birbirinden ayrılması ve özet durumunun arama sürecinin kalıcı durumu (persistent state) olarak kullanılması, hem roller arasındaki yetenek bağımlılığını hem de bağlam gürültüsünü hafifletir.
RDPO ile Rol Ayrışımlı Pekiştirmeli Öğrenme
IterSynth modelini etkin şekilde eğitmek amacıyla Role-Decoupled Policy Optimization (RDPO) pekiştirmeli öğrenme yöntemi geliştirilmiştir. RDPO, iki temel mekanizma sunar:
- Nihai görev başarısını ölçen uç sonuç ödülleri (terminal outcome rewards) ile her adımın kalitesini denetleyen tur düzeyinde rubrik değerlendirmelerini (turn-level rubric evaluations) harmanlar.
- Her rol için role özgü avantajlar (role-specific advantages) hesaplayarak, modellerin başarı ve hata payını belirleyen çok daha hassas bir kredi ataması (credit assignment) gerçekleştirir.
Deneysel Başarımlar ve Benchmark Sonuçları
BrowseComp ve Xbench-DS dahil beş uzun ufuklu derin arama kıyaslamasında IterSynth-8B, 50.7 ortalama skor elde ederek önceki en güçlü ≤8B ajan modelini +%4.2 geride bırakmıştır. Ayrıca IterSynth, modelden bağımsız (model-agnostic) bir yönlendirme (prompting) paradigması olarak, öncü tescilli modellerde ReAct ve benzeri yöntemlere kıyasla sıfır-atış (zero-shot) düzeyinde belirgin performans kazanımları sunmaktadır.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Sorumlulukların Ayrılması (Separation of Concerns): Ajan mimarilerinde planlama, araç çağırma ve sentezleme adımlarını tek bir monolitik istemde toplamak yerine Planner ve Synthesizer gibi uzman rollere ayırmak sistem kararlılığını artırır.
- Özet Odaklı State Yönetimi: Çok turlu aramalarda ham arama çıktılarını sürekli bağlam geçmişine eklemek yerine, rafine bir özet durumunu kalıcı bellek olarak taşımak token maliyetini düşürür ve dikkat kaybını (context drift) engeller.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →