LLM·3 dk okuma·

Genelleştirilmiş Görev ve Hareket Planlama Problemleri İçin Kodlama Ajanları

Paylaş
LLMEdumints Blog

Giriş: TAMP ve Genelleştirme Zorluğu

Görev ve hareket planlama (TAMP) problemleri; ayrık kararların geometrik, kinematik ve dinamik kısıtlarla sıkı sıkıya bağlı olması sebebiyle tam gözlemlenebilirlik ve nesne merkezli durum temsillerinde dahi çözülmesi en zor alanlar arasında yer alır. Genelleştirilmiş TAMP, farklı problem örnekleri arasındaki yapısal düzenliliklerden faydalanarak yeni durumlardaki hesaplama maliyetini düşürmeyi hedefler. Ancak mevcut yöntemler alana özgü yoğun mühendislik gerektirir. Bu araştırma, kodlama ajanlarının örnekler arasında başarıyla genellenebilen programlar sentezleyerek bu zahmetli süreci otomatikleştirip otomatikleştiremeyeceğini kapsamlı biçimde incelemektedir.

Metodoloji ve Deney Düzeneği

Süreçte ajanlara görev tanımı ve bir simülatör erişimi sunulur. Her ajan, belirlenen sentez bütçesi dahilinde çevreyle nasıl etkileşime gireceğini seçerek bir program geliştirir. Ardından bu program dondurularak daha önce karşılaşılmamış test örneklerinde değerlendirilir:

  • Değerlendirilen Modeller: Araştırmada Claude Code (Opus 5) ile Codex (GPT-5.6 Sol ve GPT-6 Astra) mimarileri test edilmiştir.
  • Simülasyon Ortamları: KinDER ve PDDLStream kaynaklı 28 farklı simülasyon ortamında, orijinal kıyaslamaların çok ötesindeki nesne sayılarıyla çalışılmıştır.
  • Değerlendirme Kapsamı: Farklı program sentezi yaklaşımlarıyla üretilen 980 program, 100'er adet ayrılmış test örneğinde değerlendirilerek toplamda 98.000 test epizodu gerçekleştirilmiştir.

Temel Bulgular ve Sonuçlar

Elde edilen veriler, kodlama ajanlarının genelleştirilmiş TAMP alanında şaşırtıcı derecede yüksek başarı gösterdiğini kanıtlamaktadır:

  • Üstün Başarı Oranı: Üç ajan konfigürasyonu da el ile tasarlanmış klasik planlayıcıları, tek seferlik (one-shot) kod üretimini ve LLM tabanlı genelleştirilmiş planlama taban modelini geride bırakmıştır. Klasik planlayıcıların bulunduğu 16 ortamda, geleneksel yöntemler %47 ortalama başarı sağlarken ajanlar %56 ile %95 arasında başarı elde etmiştir.
  • Ölçeklenebilirlik ve Hesaplama Verimliliği: Sahnedeki nesne sayısı arttıkça ajanların yazdığı programlar yüksek başarıyı korumuş; klasik planlayıcılara kıyasla örnek başına ortalama bir büyüklük mertebesi (yaklaşık 10 kat) daha az hesaplama kaynağı harcamıştır.
  • Etkileşimli İyileştirme: Deney kayıtları; ajanların simülasyon etkileşimini fiziksel modelleri kalibre etmek, uç durumları test etmek ve algoritmik stratejileri iyileştirmek amacıyla kullandığını göstermektedir. Araştırmacılar tüm kodları ve ajan prompt'larını açık kaynak olarak paylaşmıştır.

Yazılım Geliştirme ve Öğrenme Çıkarımları

Bu çalışma, modern yapay zeka ve yazılım geliştirme süreçleri için kritik pratik çıkarımlar sunmaktadır:

  • Çok Adımlı Araç Kullanımı (Tool Calling): Ajanların simülatör veya REPL ortamıyla etkileşime girerek araç çağırması, statik prompt'lara kıyasla hata toleransı yüksek algoritmaların geliştirilmesini sağlar.
  • Program Sentezi ile Maliyet Optimizasyonu: Her senaryoda doğrudan pahalı model çağrısı yapmak yerine genellenebilir bir kod sentezlemek, üretim ortamında çıkarım maliyetini ve gecikmeyi büyük ölçüde düşürür.
  • Test Odaklı Geliştirme (TDD) Disiplini: Ajanların nihai kodu sabitlemeden önce simülatörde uç durumları test etmesi, otonom yazılım ajanlarının geliştirilmesinde otomatik test altyapısının önemini kanıtlar.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →