Makine Öğrenmesi·2 dk okuma·

Motion-Omni: Konuşma ve Tüm Vücut Hareketini Birleştiren Uçtan Uca Sesli Diyalog Mimarisi

Paylaş
Makine ÖğrenmesiEdumints Blog

Problem: Ayrık Modeller ve Kademeli (Cascade) Yaklaşımın Sınırları

Diyalog yürüten dijital avatarların hem ne söyleyeceklerine hem de konuşurken nasıl hareket edeceklerine eşzamanlı karar vermeleri gerekir. Ancak mevcut mimarilerde bu iki yetenek birbirinden kopuk model ailelerine aittir: sesli diyalog modelleri hareketsiz konuşma üretirken, konuşma destekli hareket (co-speech motion) modelleri yalnızca kendilerine sunulan hazır ses verisi üzerinden hareket türetir. Yaygın olarak uygulanan çözüm; önce konuşma yanıtını üreten, ardından tamamlanmış ses üzerinden hareket modelini çalıştıran kademeli (cascade) bir yapıdır. Bu yaklaşım ikinci bir tam çıkarım (inference) adımı gerektirerek gecikmeyi artırır ve iki bileşen arasında ortak bir optimizasyon yapılmasını engeller.

Çözüm: Uçtan Uca Motion-Omni Mimarisi

Motion-Omni, sesli diyalog modelinin doğrudan konuşmayı üreten gizli durumlarından (hidden states) yüz ifadeleri, el, üst ve alt vücut hareketlerini yerel olarak ürettiği uçtan uca bir çerçeve sunar. Bu mimaride ortak eğitim (joint training) zorunludur: konuşma hattı dondurulduğunda hareketin sesle uyumu bozulur; LLM, Konuşma Üreticisi ve Hareket Üreticisinin her iki hedef doğrultusunda birlikte eğitilmesi (co-adaptation), konuşma yeteneğini korurken ses-hareket hizalamasını eksiksiz sağlar.

Modelin öne çıkan teknik bileşenleri şunlardır:

  • Sözde Etiketleme (Pseudo-labeling) Boru Hattı: Tutarlı ses yanıtlarını değiştirilebilir bir hareket öğretmeniyle etiketleyen, ölçeklenebilir ve modelden bağımsız bir veri hattı kurularak 422.856 kalite sıralamalı çift (1.402 saat) üretilmiştir.
  • SwDA-500 ve Açık Değerlendirme Protokolü: Stokastik ve açık uçlu tam vücut sesli diyaloglar için render, otomatik metrikler, insan değerlendirmesi ve gecikme ölçümünü birleştiren ilk kamuya açık kıyaslama protokolü sunulmuştur.
  • Yüksek Hız ve Üstün Başarım: Qwen2.5-7B-Instruct omurgasıyla kurulan Motion-Omni-Q7, referanssız hareket metriklerinde öğretmen kademesini %2 payla yakalarken 5.4 kat daha hızlı yanıt vermektedir. Gerçek zamanlıdan hızlı çalışan sistem (RTF = 0.78), ritim korelasyonu ve çeşitlilikte öğretmen harici tüm kademeli sistemleri geçmekte; %2.62 kelime hata oranı (WER) ile karşılaştırılan tüm omni-modal sistemler arasındaki en düşük hata oranına ulaşmaktadır.

Yazılım Geliştirme Açısından Pratik Çıkarımlar

  • Çıkarım Gecikmesini Düşürün: Ayrı servisleri zincirlemek yerine gizli katman düzeyinde paylaşılan temsilleri kullanmak, çift çıkarım yükünü ortadan kaldırır.
  • Gerçek Zamanlı Eşiğini Hedefleyin: RTF değerinin 0.78 seviyesine inmesi, canlı müşteri temsilcisi veya oyun içi NPC avatarlarında streaming gecikmesini minimize eder.
  • Multimodal Ortak Eğitime Odaklanın: Çok modlu üretimde modelleri dondurmak yerine ortaklaşa adapte etmek, ses ve fiziksel hareket arasındaki senkronizasyon başarısını doğrudan belirler.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.04250)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →