Yapay Zeka·3 dk okuma·

Video DeltaNet: Canlı Yayın Video Üretimi İçin Video-Native Hibrit Dikkat Mimarisi

Paylaş
Yapay ZekaEdumints Blog

Mimari Genel Bakış ve Temel İlkeler

Canlı video üretimi ve üretken yapay zeka modelleri, yüksek hesaplama maliyetleri ile gecikme süreleri nedeniyle ölçeklendirme zorluklarıyla karşılaşmaktadır. Video DeltaNet (VDN), geleneksel modellerin kısıtlarını aşmak amacıyla yenilikçi ve hibrit bir yaklaşım sunmaktadır:

  • Hesaplama Darboğazı: Video difüzyon modelleri, gürültü giderme (denoising) adımlarında uzun uzamsal-zamansal (spatiotemporal) token dizilerini sürekli işler; bu durum standart dikkat mekanizmasını temel bir hesaplama darboğazı haline getirir.
  • Doğrusal Dikkatin Sınırları: Doğrusal dikkat (linear attention) büyük dil modellerinde yaygın kabul görse de, video modellerine doğrudan uyarlandığında yüksek kaliteli üretim için kritik olan ince taneli etkileşimleri yakalamakta yetersiz kalır.
  • Video DeltaNet (VDN) Mimarisi: VDN mimarisi, uzun menzilli video bağlamını korumak adına yerel Softmax dikkati ile çift yönlü doğrusal belleği (bidirectional linear memory) dengeli bir hibrit yapıda bir araya getirir.
  • Video Delta Attention (VDA): Doğrusal branş, her karenin uzamsal token'larını topluca entegre ederek belleği kare başına yalnızca bir kez güncelleyen Video Delta Attention mekanizmasını devreye alır.
  • Dinamik Kalibrasyon ve Aşamalı Hizalama: Ayrı çıktı projeksiyonları ve öğrenilebilir kapı (gate) katmanları iki branşı kalibre eder; aşamalı öğretmen-hizalama (staged teacher-alignment) reçetesi ise yeni yolu önceden eğitilmiş modellere pürüzsüzce aktarır.
  • Çok Modlu Entegrasyon (MiniMax H3): VDN mimarisi MiniMax H3 üzerinde somutlaştırılmıştır; hibrit yapı video-video etkileşimlerine uygulanırken, metin ve ses etkileşimlerinde Softmax kararlılığı korunmuştur.
  • Üretim Performansı ve Çıkarım: 8 adımlı damıtma (distillation) ve optimize edilmiş SGLang servis yığını sayesinde VDN-H3, sekiz adet NVIDIA B200 GPU üzerinde 14.3 saniyelik 768p videonun DiT gürültü gidermesini 6.70 saniyede tamamlayarak 50 adımlı yoğun H3 taban çizgisine kıyasla 14.5 kat hızlanma sağlar.

Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar

  • Hibrit Mimari Tasarımı: Modern video modellerinde tüm mimariyi tek tip dikkat mekanizmasına zorlamak yerine, modaliteye uygun hibrit yapılar kurulmalıdır. Video içi zamansal akışlarda doğrusal bellek, metin veya ses koşullarında ise Softmax kullanılması hesaplama maliyeti ile çıktı kalitesi arasındaki dengeyi en üst seviyeye taşır.
  • Bellek ve Durum Güncelleme Optimizasyonu: VDA'nın kare bazında toplu uzamsal entegrasyonu, GPU bellek bant genişliğini optimize eder. Canlı yayın ve streaming altyapısı geliştiren mühendisler, durum (state) güncellemelerini her bir token yerine mantıksal çerçeve birimlerinde birleştirerek yüksek I/O gecikmelerini engelleyebilir.
  • Modern Servis Yığını ve Model Damıtma: Büyük difüzyon modellerini üretime taşırken tek başına mimari yenilikler yeterli değildir. 8 adımlı damıtma tekniği ile SGLang gibi donanım düzeyinde optimize edilmiş çıkarım motorlarının birlikte kullanılması, canlı yayın senaryolarını kurumsal ölçekte pratik hale getirir.

Orijinal makaleye buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Live / Stream modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →