AV-GRPO: Eşzamanlı Ses ve Video Üretimi İçin Modaliteye Dayalı Ayrıklaştırmalı Difüzyon Pekiştirmeli Öğrenme
İçindekiler
Giriş ve Mevcut Zorluklar
Son yıllarda eşzamanlı ses ve video üretimi (joint audio-video generation) alanında önemli gelişmeler kaydedilmiştir. Buna rağmen mevcut yapay zeka modelleri; her bir modalitede sınırlı üretim kalitesi (fidelity), yetersiz metin-modalite hizalaması ve zayıf modaliteler arası senkronizasyon gibi temel sorunlardan muzdariptir.
Pekiştirmeli öğrenme tabanlı eğitim sonrası optimizasyon (reinforcement learning post-training), bu eksiklikleri gidermek için güçlü bir potansiyel sunmaktadır. Ancak bu yöntemi doğrudan eşzamanlı ses-video üretimine uyarlamak üç büyük zorluğu beraberinde getirir:
- Öğrenme Sinyallerinin Karışması: Heterojen çok-modaliteli ödüller öğrenme sinyallerini iç içe geçirerek modelin kredi atamasını (credit assignment) karmaşıklaştırır.
- Yüksek Hesaplama Maliyeti: Farklı dinamiklere sahip iki ayrı modalite kulesinin (ses ve video kuleleri) ortaklaşa optimize edilmesi ciddi bir hesaplama yükü oluşturur.
- Adil Olmayan Ödül Karşılaştırmaları: Senkronizasyon değerlendirmesinin zorluğu eşleştirilmiş örneklere bağlıdır; bu durum adil bir ödül karşılaştırması yapılmasını engeller.
AV-GRPO Mimarisi ve 5DAV Veri Seti
Bu zorlukları aşmak amacıyla, modaliteye dayalı çevrim içi bir difüzyon pekiştirmeli öğrenme çerçevesi olan AV-GRPO ve ayrıklaştırılmış, zorluğu kontrol edilebilir bir eğitim veri seti olan 5DAV önerilmiştir. AV-GRPO mimarisi üç temel modülden oluşmaktadır:
- Modaliteye Dayalı Açılımlar (Modality-Anchored Rollouts): Öğrenme sinyallerini birbirinden ayrıştırır ve senkronizasyon zorluk derecesini dengeler.
- Yörünge Kilitli Dondurulmuş Kule Optimizasyonu (Trajectory-Locked Frozen-Tower Optimization): Hesaplama maliyetini düşürür ve kredi atamasını her modaliteye doğru biçimde yeniden dağıtır.
- Modaliteye Özgü Dinamiklere Göre Uyarlanan Hedefler ve Pertürbasyon Güçleri: Ses ve videonun farklı dinamik gereksinimlerine göre özelleştirilmiş adaptif hedefler ve gürültü/pertürbasyon seviyeleri sunar.
Bu modüller, birbirine bağlı çok-modaliteli tercih öğrenimini tek-modaliteli (unimodal) alt problemlere dönüştürerek hassas ödül ataması ve daha güçlü bir senkronizasyon sağlar. Sistematik eğitimi destekleyen 5DAV veri seti ise örnekleri beş farklı boyutta ayrıştırmaktadır.
JavisBench ve VABench kıyaslama testlerinde gerçekleştirilen deneyler; AV-GRPO'nun hem LoRA hem de tam ince ayar (full fine-tuning) koşullarında üretim kalitesi, semantik hizalama ve senkronizasyon açılarından LTX-2.3 modelini geride bıraktığını kanıtlamaktadır. Kapsamlı ablasyon çalışmaları da mimari tercihlerin başarısını doğrulamaktadır. Çalışmanın açık kaynak kodlarına ve veri setine GitHub (https://github.com/zhiyuxu03/AV-GRPO) ve makale kaynaklarına (https://huggingface.co/papers/2609.29816) ilgili platformlardan erişilebilmektedir.
Yazılım Geliştirme ve Öğrenme Çıkarımları
- Çoklu Çıktılarda Alt Problemlere Bölme: Birden fazla modalite üreten karmaşık mimarilerde, tüm kuleleri tek bir karmaşık sinyalle eğitmek yerine alt problemlere ayırmak optimizasyonu stabilize eder.
- Dondurulmuş Katmanlarla Kaynak Yönetimi: Trajectory-locked frozen-tower yaklaşımı, sınırlı GPU bütçeleriyle büyük çok-modaliteli modelleri optimize ederken donanım maliyetlerini ciddi oranda düşürür.
- Kontrollü Test ve Doğrulama Setleri: Çok-modaliteli sistemlerin kalitesini ve senkronizasyonunu ölçmek için zorluk parametreleri kontrol edilebilen 5DAV benzeri sentetik veri setleri oluşturmak test güvenilirliğini artırır.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →