OneStreamer: Akış Halindeki Video Etkileşiminde Algı, Bellek ve Proaktif Yanıtın Birleştirilmesi
İçindekiler
Canlı video akışlarını işleyen Büyük Dil Modelleri (Streaming Video LLMs), gelecekteki görevlerle ilişkisi henüz bilinmeyen görsel ipuçlarını bellekte tutmak ve yeterli kanıt toplandığında zaman kaybetmeden doğru yanıtı vermek zorundadır. Buradaki temel mimari zorluk, gerçek zamanlı görsel algılama yeteneğini yavaşlatmadan yeniden kullanılabilir olgusal bir bellek oluşturmaktır. OneStreamer, paylaşılan proaktif bir üretim süreci üzerinden sorgudan bağımsız kanıt kaydı tutmayı ve görev yanıtlamayı birlikte öğrenerek bu ikilemi ortadan kaldırır.
Temel Mimari Çözümler
- Proaktif Hiyerarşik Altyazı Belleği (PHCM): Zamana bağlı yerel detay altyazıları ve tamamlanan olayların özetlerini üretir. Eğitimde akış altyazı hedefleri, gözlemlenen video öneklerinin yorumlanmasını denetler. Çıkarım (inference) aşamasında ise modelin kendi ürettiği bu kayıtlar son görsel pencereyi destekler; böylece geçmiş görsel özelliklere tekrar dönülmeden yeniden kullanılabilir olgusal bir bağlam sağlanır.
- Proaktif Durum Geçiş Öğrenimi (PSTL): Sürekli tekrarlanan pasif bekleme durumlarının baskınlığını kırar. Çıktı çıpalarındaki denetimi korurken durum değişikliği ve durum sürekliliğini temsil eden kritik belirteçleri (tokens) seçer. Yalnızca etiketli durum belirteçlerinin %27,5'ini denetleyerek yoğun durum denetiminden daha yüksek başarım sergiler.
- Akış Veri Sentezi ve OneStreamer-1M: Çıktı içeriğini ve zamanlamasını mevcut kanıtlarla hizalayan bir akış veri sentezleme hattı geliştirilmiştir. Elde edilen akış altyazıları ve soru-cevap çiftleri, temizlenmiş açık kaynaklı verilerle birleştirilerek çeşitli görevleri kapsayan bir milyondan fazla kayıtlık OneStreamer-1M veri kümesi oluşturulmuştur.
Benchmark Sonuçları ve Başarımlar
Sekiz farklı akış videosu anlama testinde değerlendirilen 4B (4 milyar) parametreli OneStreamer modeli, kıyaslanan tüm yöntemler arasında en yüksek başarıyı elde etmiştir. Ablasyon analizleri; üretilen altyazıların saklanmasının anlık algıyı bozmadan geçmişe dönük soru-cevap (QA) kalitesini artırdığını ve proaktif üretimin algı, bellek ve zamanında yanıt arasında ortak bir öğrenme arayüzü kurduğunu doğrulamaktadır.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Görsel Feature Yerine Yapılandırılmış Metin Belleği: Video akışlarında ham görsel gömmeleri (embeddings) bellekte tutmak bellek darboğazlarına yol açar. Olayları metin özetlerine dönüştürerek saklamak, bağlam penceresini ve RAM tüketimini optimize eder.
- Seyrek Denetim ile Düşük Hesaplama Maliyeti: Durum makinelerinde sürekli 'bekle' durumunu denetlemek yerine kritik durum geçiş token'larına odaklanmak, eğitim ve çıkarım maliyetini önemli ölçüde düşürür.
- Uç Cihazlarda Güçlü Ajan Entegrasyonu: 4B gibi kompakt bir modelin kapsamlı sentez veri setleriyle eğitilerek yüksek başarı yakalaması, gerçek zamanlı video ajanlarının hafif modellerle prodüksiyonda koşturulabileceğini gösterir.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Live / Stream modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →