---
title: "Dynin-Robotics: Çok Modlu Birleşik Difüzyon Tabanlı Görme-Dil-Eylem (VLA) Modeli"
url: https://blog.edumints.com/dynin-robotics-cok-modlu-birlesik-difuzyon-tabanli-gorme-dil-c45e5j7i
category: "Makine Öğrenmesi"
date: 2026-09-15T15:14:56.947Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.13053
---

# Dynin-Robotics: Çok Modlu Birleşik Difüzyon Tabanlı Görme-Dil-Eylem (VLA) Modeli

Görsel hedef ve dinamik tahmini, doğal dil komutlarıyla yönlendirilen robotik politikalara hem ulaşılması gereken nihai hedef durumunu hem de eylemlerin ortamda meydana getireceği sahne değişikliklerinin anlamsal temsilini sağlar. **Dynin-Robotics**, bu tahmin mekanizmalarını paylaşımlı tek bir yörünge modeli üzerinden eylem üretimi ve eylem seçimi süreçleriyle doğrudan buluşturan yenilikçi bir Görme-Dil-Eylem (VLA) yaklaşımı sunmaktadır.

## Birleşik Yörünge Modeli ve Omnimodal Difüzyon Mimarisi

Klasik robotik yaklaşımlarda kontrol politikası ve çevre dinamikleri genellikle ayrı modellerle ele alınırken, Dynin-Robotics bu ayrımı ortadan kaldırır. Model, çok modlu maskeli difüzyon omurgası olan **Dynin-Omni** üzerinde yapılandırılmıştır. Bu omurgada dil komutları, görsel gözlemler, nihai hedefler ve düşük seviyeli eylemler ayrık belirteçler (**discrete tokens**) olarak ortak bir uzayda temsil edilir.

Model; koşullandırma (conditioning) ve hedef aralıklarını dinamik biçimde değiştirerek tek bir ağırlık kümesiyle birbiriyle bütünleşik şu yetenekleri öğrenir:

- **Eylem Tahmini:** Verilen görsel duruma ve kullanıcı talimatına uygun hassas robot eylemlerinin doğrudan üretilmesi.
- **Eyleme Koşullu Sonraki Gözlem Tahmini:** Seçilen bir eylemin ortamda yaratacağı yeni görsel durumun ve dinamiklerin simüle edilmesi.
- **Nihai Hedef Durumu Kestirimi:** Görev başarıyla sonuçlandığında robotun ve çevrenin ulaşacağı terminal görsel durumun öngörülmesi.
- **Yörüngeden Talimat Rekonstrüksiyonu:** Gerçekleştirilen hareket dizisinden, o görevi tanımlayan dilsel talimatın tersine mühendislikle yeniden üretilmesi.

Bu çoklu arayüz yapısı; hedef rehberliği, aday eylemlerin değerlendirilmesi ve eylem ile gelecek durum tahminlerinin ortak gürültü giderme (**joint refinement / denoising**) adımlarıyla iyileştirilmesi sayesinde test zamanı ölçeklemesini (**test-time scaling**) mümkün kılar.

## Performans, Donanım Doğrulaması ve Mühendislik Çıkarımları

Dynin-Robotics, 48 farklı **Open X-Embodiment** veri setinden derlenen yaklaşık 1,33 milyon yörünge üzerinde sürekli ön eğitime (**continual pretraining**) tabi tutulmuş ve alt alanlara uyarlanmıştır:

- **VLABench Kıyaslaması:** Sabit ikinci aşama adım bütçesinde hızlı adaptasyon sağlanmış; tüm hedefleri içeren karma eğitim (full objective mixture), yalnızca politika odaklı eğitime kıyasla değişen talimat koşullarında başarıyı belirgin şekilde artırmıştır.
- **Fiziksel Robot Başarımı:** Simülasyondaki LIBERO ve sıfır-örnekli LIBERO-Plus testlerinde yüksek rekabetçilik sergileyen model, **Franka Research 3** fiziksel robot kolu üzerinde dört manipülasyon koşulunda ortalama **%78,4** başarı oranına ulaşmıştır.
- **Blok-Paralel Çıkarım Optimizasyonu:** Difüzyon modellerinin en büyük kısıtlaması olan çıkarım gecikmesi, optimize edilmiş blok-paralel mimariyle aşılmıştır. Bu yöntem, baz uygulamaya kıyasla model tarafındaki eylem kod çözme süresini **29,2 kata kadar** hızlandırarak gerçek zamanlı robot kontrolünü uygulanabilir kılmıştır.

Yazılım mühendisleri ve yapay zekâ geliştiricileri için bu çalışma, ayrık belirteç tabanlı paylaşımlı difüzyon modellerinin robotikte hem bir dünya modeli hem de ölçeklenebilir bir kontrolcü olarak tek çatı altında verimli şekilde çalışabileceğini göstermektedir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.13053)

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.13053)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/dynin-robotics-cok-modlu-birlesik-difuzyon-tabanli-gorme-dil-c45e5j7i
