Yapay Zeka·2 dk okuma·

VLM Ajanları ile Bağlam İçi Robotik Öğrenme: GPT-Policy

Paylaş
Yapay ZekaEdumints Blog

Embodied AI ve Bağlam İçi Öğrenme

Robotların daha önce hiç karşılaşmadıkları yeni ortamlara tıpkı insanlar gibi hızla adapte olabilmesi, fiziksel yapay zeka (embodied AI) alanının en kritik "moonshot" hedeflerinden biri olmaya devam etmektedir. Sonlu sayıda gösterim verisi toplamak, bir robotun sahada karşılaşabileceği tüm olası durum ve görevleri bütünüyle kapsayamaz. Bu durum, modellerin dağıtım (deployment) anında ortam bağlamından anlık olarak öğrenebilmesini (In-Context Learning - ICL) bir zorunluluk haline getirmektedir. Ancak geleneksel robotik kontrol politikaları için parametre güncellemesi yapmadan bağlam içi öğrenme gerçekleştirmek bugüne kadar ulaşılamaz bir kabiliyet olarak kalmıştır.

Görsel-Dil Modellerinin (VLM) sergilediği güçlü ajan yetenekleri şu temel soruyu gündeme getirmektedir: Bu modeller; video gösterimlerinden, örneklerden ve anlık etkileşim geri bildirimlerinden öğrenerek, hiçbir gradyan güncellemesi veya kalıcı parametre değişikliği yapmadan yeni bir başlangıç durumunda çalıştırılabilir ve doğrulanabilir robotik davranışlar üretebilir mi?

GPT-Policy Mimarisi ve Temel Bileşenleri

Bu soruya somut bir çözüm sunmak amacıyla geliştirilen GPT-Policy, bağlam içi robotik öğrenme için tasarlanmış genel bir ajan çerçevesidir. Sistem üç temel bileşeni kusursuz şekilde entegre eder:

  • Bağlam Derleyici (Context Compiler): Görevle doğrudan ilgili görsel durum geçişlerini ve kritik anları süzerek bağlam penceresinde saklar.
  • VLM Ajanı: Görsel ve metinsel bağlamı işleyerek robot veya araç kullanımı için uygun aksiyon önerileri üretir.
  • Kısıtlı Kontrolcü (Constrained Controller): Önerilen her eylemi fiziksel güvenlik ve kısıt kurallarına göre doğrular, robot üzerinde yürütür ve sonucu geri bildirim olarak sisteme raporlar.

Değerlendirme ve Temel Bulgular

GPT-Policy'nin güvenilirliği ve sınırları; görev başarısı ve verimlilik metrikleri, modeller arası karşılaştırmalar ve kontrollü bağlam ablasyonları ile incelenmiştir:

  • Etiketlenmemiş İnsan Videoları: Robot aksiyon etiketleri içermeyen insan tanıtım videoları dahi görev tamamlama başarısını belirgin şekilde artırmaktadır.
  • Hizalanmış Aksiyon Referansları: Özellikle temasa duyarlı ve hassas fiziksel görevlerde, hizalanmış eylem referanslarının eklenmesi başarı ve verimliliği çok daha üst seviyelere taşımaktadır.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

GPT-Policy, büyük modellerin genel yeteneklerini fiziksel davranışlara dönüştürmek için önemli mimari prensipler sunar:

  • Doğrulama ve Kısıt Katmanı (Guardrail): VLM'lerin ürettiği eylemler doğrudan yürütülmemeli; araya giren kısıtlı bir kontrolcü ile doğrulanabilir ve güvenli kılınmalıdır.
  • Kapalı Döngü Geri Bildirim (Closed-Loop): Dağıtım anında model eğitmek yerine, eylemlerin sonucunu anlık geri bildirimle bağlama beslemek sistemin hatalardan toparlanmasını sağlar.
  • Bağlam Optimizasyonu: Tüm veri akışını göndermek yerine bir bağlam derleyicisi mantığıyla sadece durum geçişlerini iletmek gecikme ve token maliyetini optimize eder.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.19138)


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →