Makine Öğrenmesi·3 dk okuma·

Seç, Sıkıştır ve Yeniden Yatır: Uzun Video MLLM Modellerinde Görsel Token Dağıtımı

Paylaş
Makine ÖğrenmesiEdumints Blog

Uzun video dil modelleri (MLLM'ler), hesaplama ve bağlam penceresi kısıtları nedeniyle bir videodaki her kareyi doğrudan işleyemez. Örneğin, saniyede bir kare örneklenen bir saatlik bir video 3.600 görsel kare üretir; sistemler ise bu havuzun yalnızca çok küçük ve sabit bir kesitini tutabilir. Mevcut yaklaşımlar hangi karelerin seçileceğini genellikle önemsiz bir ön işleme detayı gibi ele alırken, bu kontrollü çalışma token tahsis stratejisinin model doğruluğundaki belirleyici etkisini araştırmaktadır. Çalışmada; kare skorlayıcı, istem sınırı, çözünürlük stratejisi ve yanıt modeli sabit tutularak altı eğitime ihtiyaç duymayan seçim kuralı, üç uzun video kıyaslaması ve iki yanıt modeli üzerinde şu üç ana karar tek tek incelenmiştir:

Temel Bulgular ve Token Optimizasyon Kararları

  • 1. Seçim (Selection) - En Büyük Performans Kaldıracı: Hangi karelerin seçildiği, başarıyı belirleyen en kritik tekil faktördür. LongVideoBench'in 1 saatlik video diliminde, kullanıcı sorgusuna göre seçilen 8 kare, video geneline eşit aralıklarla (uniform) yerleştirilen 16 kareden 6.9 puan daha yüksek başarım sağlamıştır. Ayrıca, onlarca yıllık klasik bir seyrek yaklaşım algoritması olan OMP (Orthogonal Matching Pursuit), bu amaca yönelik sıfırdan geliştirilmiş tüm modern seçicilerle tüm kıyaslamalarda başa baş ya da 1 puan yakınında performans göstermiştir.

  • 2. Mekânsal Sıkıştırma (Spatial Compression) - Neredeyse Maliyetsiz: Sabit zaman damgalarında her karenin mekânsal piksel ve token bütçesini yarıya indirmek, doğruluğu en fazla 0.44 puan düşürmüştür. Bu durum, görsel dil modellerinin tek tek karelerin ince detaylarından ziyade genel zamansal bağlama ihtiyaç duyduğunu ve sıkıştırmanın neredeyse kayıpsız bir alan açtığını kanıtlamaktadır.

  • 3. Yeniden Yatırım (Reinvestment) - Tasarrufun Doğruluğa Dönüşümü: Sıkıştırma işlemi tek başına bırakıldığında kayda değer bir getiri sunmaz; asıl kazanım, serbest kalan token bütçesinin akıllıca harcanmasıyla gerçekleşir. Boşa çıkan token bütçesini iki kat daha fazla sıkıştırılmış kare için harcamak, ilk 8 karelik maliyet sınırını aşmadan modele 2 ila 3 puanlık net bir doğruluk artışı getirmektedir.

Yazılım Geliştirme ve Öğrenme Çıkarımları

  • Karmaşık Seçiciler Yerine Klasik Algoritmalar: MLLM video işleme boru hatlarında maliyetli derin öğrenme seçicileri yerine OMP gibi hafif, denenmiş matematiksel algoritmaları kullanmak, minimum gecikmeyle en yüksek verimi sağlar.
  • Token Bütçesi Yönetimi (Daha Çok Kare, Daha Düşük Çözünürlük): Üretim ortamında modelleri az sayıda yüksek çözünürlüklü kareyle beslemek yerine, düşük çözünürlüklü ancak zamana daha iyi dağıtılmış çok sayıda kareyle beslemek bağlam kalitesini maksimize eder.
  • Kontrollü Test Çatısı (Harness) Zorunluluğu: Aynı kuralların iki farklı test çatısında çalıştırıldığında 0.07 ila 3.74 puanlık tutarsızlıklar üretmesi ve temel AKS uygulamasındaki yazılımsal hata, çok modlu yapay zekâ geliştirmede yayınlanan metrikleri doğrudan kabul etmek yerine kontrollü bir test ortamında A/B testleri yapmanın zorunlu olduğunu göstermektedir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.03820)


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →