LLM·2 dk okuma·

Daha Az Token, Daha İyi Eylem: GPT-6 Astra Robot Ajanları ile %14 Daha Yüksek Başarı ve %65 Daha Az Token

Paylaş
LLMEdumints Blog

Görsel dil modelleri (VLM), robotik sistemlerin görsel geri bildirimler ve eylem primitifleri aracılığıyla fiziksel dünyada yönlendirilmesinde devrim yaratmaktadır. Ancak mevcut ajan mimarilerinde modelin her adımda tekrar tekrar çağrılması ve her döngüde yüksek boyutlu ortam gözlemlerinin modele taşınması, ciddi bir token israfına ve işlem gecikmesine yol açmaktadır. Bu makalede tanıtılan PyRUA-Lean çerçevesi, klasik araç çağırma (tool-calling) mantığı yerine etkileşimli kod yürütmeyi merkeze alarak hem görev başarı oranını artırmakta hem de token tüketimini önemli ölçüde düşürmektedir.

Araştırmanın Temel Mimarisi ve Bulguları

Makalede sunulan mimari ve deneysel sonuçlar 5 temel yapı taşı üzerinden aktarılmaktadır:

  • VLM Ajanlarında Gözlem ve Token Yükü: Görsel geri bildirim ve eylem primitifleri kullanan robot ajanları, sürekli model tetiklemeleri ve gereksiz görsel gözlemler nedeniyle yüksek token maliyeti ve hesaplama yüküyle karşılaşmaktadır.
  • PyRUA-Lean ile İnteraktif Kod Yürütme: Geri bildirim odaklı primitif kompozisyonu ile seçici gözlemi birleştiren bu çerçeve; klasik robot primitiflerini ve eğitilmiş VLA (Vision-Language-Action) politikalarını Python hücrelerine dönüştürür. Sistem, yerel hata denemeleri ve koşullu kontroller yürüterek yeniden planlama için modele yalnızca açıkça talep edilen görüntü ve durum geri bildirimlerini döner.
  • 700 Görevlik Simülasyon Kıyaslaması: LIBERO-PRO, RoboTwin 2.0 ve RoboCasa365 ortamlarından derlenen 700 simüle edilmiş görev üzerinde, aynı GPT-6 Astra planlayıcısı ve robot primitiflerini kullanan standart bir araç çağırma (tool-calling) taban çizgisiyle karşılaştırma yapılmıştır.
  • Eşit Çağrı Bütçesinde %14 Başarı Artışı: Eşit LLM çağrı bütçesi altında test edildiğinde PyRUA-Lean, genel görev başarı oranını %63,1 seviyesinden %71,7 seviyesine çıkarmıştır.
  • %49 Daha Az Çağrı ve %65 Token Tasarrufu: Her iki ajan tarafından başarıyla çözülen ortak görevlerde PyRUA-Lean, %49 daha az LLM çağrısı yapmış ve %65 daha az girdi tokenı harcamıştır.

Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar

Otonom ajanlar ve çok adımlı sistemler inşa eden yazılım geliştiriciler için bu çalışma hayati pratik prensipler sunmaktadır:

  • JSON Tool-Calling Yerine Kod Yürütme (Code Execution): Ajanın her mikro eylem için ayrı bir araç çağırma şeması üretmesi yerine doğrudan Python kodu çalıştırması, bağlam penceresinin (context window) şişmesini engeller ve yürütme hızını artırır.
  • Yerel Kontrol ve Yeniden Deneme Döngüleri: Hata yakalama, koşullu dallanma ve yeniden deneme mekanizmalarının doğrudan istemci tarafındaki kod hücrelerinde çözülmesi, modele gereksiz dönüş yapılmasını önler.
  • Seçici Gözlem (Selective Observation): Tüm sensör ve görüntü verilerini her turda modele aktarmak yerine, yalnızca planlayıcının açıkça ihtiyaç duyduğu durumları getirmek hem gecikmeyi hem de token maliyetini minimize eder.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →