Görme-Eylem Kestirmelerini Aşmak: Genelletilebilir Robot Temel Modelleri İçin Gizil Arayüz Eğitimi (LIT)
İçindekiler
Robotik Temel Modellerinde Görsel Kestirme Yollar (Vision-Action Shortcuts)
Robot temel modelleri (robot foundation models), dağıtım içi (in-distribution) ortamlarda yüksek başarı gösterse de görsel dağılım kaymalarına (distribution shifts) maruz kaldığında ciddi performans kaybı yaşar. Önceden eğitilmiş görsel temsiller üzerinden eylem üretimi öğrenilirken modeller; eğitim dağılımında gösterilen eylemlerle tesadüfen korelasyon sergileyen ancak görevle ilgisi bulunmayan görsel ipuçlarını ("kestirme yolları") sömürme eğilimindedir. Ortam koşulları, aydınlatma veya kamera açıları değiştiğinde bu sahte korelasyonlar geçersiz kalır ve modelin genelleme yeteneği çöker.
Bu görsel-eylem kestirmelerini önlemek, görevle doğrudan ilgili mekânsal bilgileri korurken görsel verinin eylem üretiminde nasıl kullanılacağını sıkı bir şekilde sınırlandırmayı gerektirir. Makale, bu problemi çözmek amacıyla modelden bağımsız (framework-agnostic) iki aşamalı bir yöntem olan Latent Interface Training (LIT) yaklaşımını önermektedir.
İki Aşamalı LIT Eğitim Stratejisi
LIT stratejisi, eylem üretimini görsel gürültüden izole etmek amacıyla süreci iki aşamada kurgular:
- Aşama 1 (Görsel Olmayan Mekânsal-Hedef Eylem Önceliği): İlk aşamada eylem uzmanı (action expert), hiçbir görüntü verisi kullanılmadan eğitilir. Model; verilen doğal dil talimatı, robotun anlık durumu ve gösterilen her eylem öbeğinin terminal $SE(3)$ uç işlevci (end-effector) pozuna göre koşullandırılır. Böylece sistem, görsel ipuçlarından bağımsız olarak hedefe yönelik eylem blokları (action chunks) üretmeyi öğrenir.
- Aşama 2 (Poz Denetimli Gizil Arayüz): İkinci aşamada, görsel ve anlamsal temsilleri toplayan bir gizil arayüz (latent interface) sisteme dahil edilir. Bu arayüz, eğitilen eylem uzmanının dış dünya ile tek görsel koşullandırma kanalı olarak işlev görür. Arayüz, Aşama 1'de kullanılan terminal pozu yeniden oluşturacak (reconstruct) şekilde denetlenir. Bu denetim, arayüzün yalnızca eylem üretimi için elzem olan hedefe yönelik mekânsal bilgileri korumasını sağlar.
Deneysel Başarı ve Mimari Uyumluluk
LIT yöntemi, dört farklı görsel-dil-eylem (VLA) ve dünya-eylem mimarisinde (Pi0.5, MolmoAct2, FAST-WAM ve ImageWAM) test edilmiştir:
- Simülasyon Değerlendirmesi: Temel LIBERO başarısını korurken veya artırırken, görsel kaymaları içeren LIBERO-Plus kıyaslamasında genel başarıyı 3.87 ila 10.70 yüzdelik puan artırmıştır.
- Gerçek Dünya Doğrulaması: Eğitimde hiç görülmemiş kamera açıları, ışıklandırma varyasyonları ve dikkat dağıtıcı nesneler içeren üç farklı gerçek dünya görevinde 13.30 ila 16.70 yüzdelik puanlık genel başarı artışı sağlamıştır.
Yazılım Geliştiricileri İçin Pratik Çıkarımlar
- Sahte Korelasyonları (Shortcut Learning) Engelleme: Yüksek boyutlu görsel girdileri doğrudan karar katmanlarına bağlamak aşırı uyuma (overfitting) yol açar. Temsil katmanını ara fiziksel kısıtlarla (ör. $SE(3)$ uç işlevci pozu) denetlemek sistem dayanıklılığını artırır.
- Ayrıştırılmış (Decoupled) Ajan Mimarisi: Algılama ile eylem üretimini bağımsız adımlarda eğitmek, dağılım dışı (OOD) testlerde modellerin kırılganlığını minimize eder.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.12641)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →