Dynin-Robotics: Çok Modlu Birleşik Difüzyon Tabanlı Görme-Dil-Eylem (VLA) Modeli
İçindekiler
Görsel hedef ve dinamik tahmini, doğal dil komutlarıyla yönlendirilen robotik politikalara hem ulaşılması gereken nihai hedef durumunu hem de eylemlerin ortamda meydana getireceği sahne değişikliklerinin anlamsal temsilini sağlar. Dynin-Robotics, bu tahmin mekanizmalarını paylaşımlı tek bir yörünge modeli üzerinden eylem üretimi ve eylem seçimi süreçleriyle doğrudan buluşturan yenilikçi bir Görme-Dil-Eylem (VLA) yaklaşımı sunmaktadır.
Birleşik Yörünge Modeli ve Omnimodal Difüzyon Mimarisi
Klasik robotik yaklaşımlarda kontrol politikası ve çevre dinamikleri genellikle ayrı modellerle ele alınırken, Dynin-Robotics bu ayrımı ortadan kaldırır. Model, çok modlu maskeli difüzyon omurgası olan Dynin-Omni üzerinde yapılandırılmıştır. Bu omurgada dil komutları, görsel gözlemler, nihai hedefler ve düşük seviyeli eylemler ayrık belirteçler (discrete tokens) olarak ortak bir uzayda temsil edilir.
Model; koşullandırma (conditioning) ve hedef aralıklarını dinamik biçimde değiştirerek tek bir ağırlık kümesiyle birbiriyle bütünleşik şu yetenekleri öğrenir:
- Eylem Tahmini: Verilen görsel duruma ve kullanıcı talimatına uygun hassas robot eylemlerinin doğrudan üretilmesi.
- Eyleme Koşullu Sonraki Gözlem Tahmini: Seçilen bir eylemin ortamda yaratacağı yeni görsel durumun ve dinamiklerin simüle edilmesi.
- Nihai Hedef Durumu Kestirimi: Görev başarıyla sonuçlandığında robotun ve çevrenin ulaşacağı terminal görsel durumun öngörülmesi.
- Yörüngeden Talimat Rekonstrüksiyonu: Gerçekleştirilen hareket dizisinden, o görevi tanımlayan dilsel talimatın tersine mühendislikle yeniden üretilmesi.
Bu çoklu arayüz yapısı; hedef rehberliği, aday eylemlerin değerlendirilmesi ve eylem ile gelecek durum tahminlerinin ortak gürültü giderme (joint refinement / denoising) adımlarıyla iyileştirilmesi sayesinde test zamanı ölçeklemesini (test-time scaling) mümkün kılar.
Performans, Donanım Doğrulaması ve Mühendislik Çıkarımları
Dynin-Robotics, 48 farklı Open X-Embodiment veri setinden derlenen yaklaşık 1,33 milyon yörünge üzerinde sürekli ön eğitime (continual pretraining) tabi tutulmuş ve alt alanlara uyarlanmıştır:
- VLABench Kıyaslaması: Sabit ikinci aşama adım bütçesinde hızlı adaptasyon sağlanmış; tüm hedefleri içeren karma eğitim (full objective mixture), yalnızca politika odaklı eğitime kıyasla değişen talimat koşullarında başarıyı belirgin şekilde artırmıştır.
- Fiziksel Robot Başarımı: Simülasyondaki LIBERO ve sıfır-örnekli LIBERO-Plus testlerinde yüksek rekabetçilik sergileyen model, Franka Research 3 fiziksel robot kolu üzerinde dört manipülasyon koşulunda ortalama %78,4 başarı oranına ulaşmıştır.
- Blok-Paralel Çıkarım Optimizasyonu: Difüzyon modellerinin en büyük kısıtlaması olan çıkarım gecikmesi, optimize edilmiş blok-paralel mimariyle aşılmıştır. Bu yöntem, baz uygulamaya kıyasla model tarafındaki eylem kod çözme süresini 29,2 kata kadar hızlandırarak gerçek zamanlı robot kontrolünü uygulanabilir kılmıştır.
Yazılım mühendisleri ve yapay zekâ geliştiricileri için bu çalışma, ayrık belirteç tabanlı paylaşımlı difüzyon modellerinin robotikte hem bir dünya modeli hem de ölçeklenebilir bir kontrolcü olarak tek çatı altında verimli şekilde çalışabileceğini göstermektedir.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →