AI Araçları·2 dk okuma·

EmbodiedSkills: VLA Ajanlarını Yönetme, Eğitme ve Dağıtma için Bütünleşik Bir Çerçeve

Paylaş
AI AraçlarıEdumints Blog

Görsel-dil-eylem (Vision-Language-Action - VLA) modelleri; görsel gözlemleri ve doğal dil komutlarını doğrudan robotik eylemlere dönüştürmede önemli bir potansiyele sahiptir. Ancak uzun vadeli ve çok adımlı (long-horizon) fiziksel görevler, yalnızca izole bir eylem tahmininden çok daha fazlasını gerektirir. Fiziksel ortam ve durum sürekli evrilirken; bir ajanın algılama, planlama, yürütme, ilerleme doğrulaması (progress verification) ve hata kurtarma (recovery) süreçlerini dinamik olarak koordine etmesi zorunludur. Tek başına bir modelin ürettiği beceri kararı, işlemin mevcut ortam durumunda geçerli olduğunu veya hedeflenen sonucu sağlayacağını garanti edemez.

EmbodiedSkills Mimarisi

Bu temel sorunu çözmek amacıyla geliştirilen EmbodiedSkills, her beceri kararını bağımsız bir "yürütme teklifi" (execution proposal) olarak ele alan bütünleşik bir çerçevedir. Sistemin mimarisi üç temel mekanizmaya dayanır:

  • Ön Koşul Denetimi ve Sonuç Doğrulama: Çalışma zamanı (runtime), bir eylemi çalıştırmadan önce ön koşulları (prerequisites) doğrular ve eylem bittikten sonra hedeflenen çıktıyı denetler.
  • Paylaşımlı Yürütülebilir Beceri Arayüzü: Üst düzey beceri planlamasını, sınırlandırılmış alt düzey VLA eylemlerini ve işlem sonrası doğrulamayı tek bir ajan döngüsünde birleştirir. Sabit kalan bu arayüz sayesinde alt düzey VLA politikaları, ana ajan döngüsüne dokunulmadan kolayca değiştirilebilir veya uyarlanabilir.
  • Yapılandırılmış Yörünge Kaydı (Trajectories): Planlama, çalıştırma, doğrulama ve hata kurtarma adımları yapılandırılmış kayıtlar olarak saklanır. Bu izler, modellerin eğitimi için denetim verisi sağlarken, etkileşimli geri bildirimle çevrim içi uyarlamayı (online adaptation) destekler.

Deneysel Başarı ve Benchmark Sonuçları

EmbodiedSkills, Qwen3-VL ve OpenPI/pi0.5 modelleri ile somutlaştırılarak RoboTwin 2.0, LIBERO ve RMBench simülasyon ortamlarında kapsamlı testlere tabi tutulmuştur:

  • RoboTwin 2.0: Göreve uyarlanan alt düzey VLA politikaları, 50 farklı görev genelinde ortalama %86.20 başarı oranına ulaşmıştır.
  • LIBERO: Dört farklı test paketinde ortalama %97.40 gibi dikkate değer bir başarı sergilemiştir.
  • RMBench: Belleğe dayalı (memory-dependent) dört karmaşık görevde ise aynı yürütme yaklaşımı ortalama %12.5 başarı elde etmiştir.

Yazılım ve Ajan Geliştiricileri İçin Pratik Çıkarımlar

Yazılım mühendisliği perspektifinden bakıldığında EmbodiedSkills, açık döngülü modelleri güvenilir, kapalı döngülü (closed-loop) somutlaşmış sistemlere dönüştürmek için kritik prensipler sunar:

  • Sözleşmeli Tasarım (Design by Contract): Üretken modellerin kararları doğrudan yürütülmemeli; eylem öncesi ön koşullar ve eylem sonrası durum doğrulamaları zorunlu kılınmalıdır.
  • Gözlemlenebilirlik ve Hata Kurtarma: Olayların yapılandırılmış yörüngeler olarak kaydedilmesi, prodüksiyondaki ajan davranışlarının izlenmesini, denetlenmesini ve gerektiğinde kurtarma adımlarının devreye alınmasını sağlar.
  • Modüler Soyutlama: Yüksek seviyeli karar mantığı ile düşük seviyeli eylem politikalarının standart bir arayüzle ayrılması, altyapı bağımlılıklarını azaltır ve model güncellemelerini sorunsuz kılar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.01281)


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →