LLM·3 dk okuma·

ColNanoVDR: Optimal Taşıma ile Çok Vektörlü Görsel Belge Erişiminde Belgesiz Sorgu Damıtımı

Paylaş
LLMEdumints Blog

Çok Vektörlü Görsel Belge Erişiminde Üretim ve Performans Optimizasyonu

Görsel belge erişimi (Visual Document Retrieval - VDR), çok modelli yapay zekâ sistemlerinde taranmış PDF'ler, infografikler ve formlar gibi görsel ağırlıklı belgelerin aranmasında kritik bir rol oynar. Bu alandaki son yenilikleri yazılım geliştirme ve MLOps perspektifinden inceleyen 9 temel çıkarım şunlardır:

  • VLM Tabanlı Çok Vektörlü Getiriciler ve Çıkarım Maliyeti: Görsel dil modelleri (VLM) üzerine kurulan çok vektörlü (multi-vector) getiriciler görsel belge erişiminde (VDR) son teknoloji başarı sunar. Ancak her arama sorgusunda milyarlarca parametreli devasa bir görsel-dil modelini çalıştırmak, canlı üretim sistemlerinde yüksek GPU altyapı maliyeti ve kabul edilemez gecikme (latency) darboğazları meydana getirir.
  • Sorgu Kodlayıcı Damıtımı ile Darboğazı Aşmak: Bu performans darboğazını gidermenin en pratik yazılım mühendisliği çözümü, sorgu kodlayıcıyı hafif bir öğrenci (student) modele damıtmaktır (distillation). Bu sayede hafifletilmiş öğrenci model, öğretmenin önceden indekslenmiş devasa doküman vektör havuzunu doğrudan ve çok düşük kaynak tüketimiyle sorgulayabilir.
  • Geleneksel MaxSim Puan Damıtımının Depolama Yükü: Standart damıtma reçeteleri öğretmenin MaxSim benzerlik puanlarını birebir eşleştirmeye odaklanır. Ancak bu yöntem, eğitim veri setindeki tüm sayfaların tek tek kodlanıp önbelleğe alınmasını gerektirir; bu da MLOps veri hatlarında terabaytlarca sayfa belirteci (token) saklama ve yüksek disk I/O maliyeti yaratır.
  • NanoVDR Yaklaşımı ve Tek Vektör Sınırı: NanoVDR yöntemi, yalnızca öğretmenin sorgu gömmeleri (query embeddings) üzerinden eğitim yaparak sayfaları saklama zorunluluğunu tamamen ortadan kaldırmıştır. Ne var ki bu çözüm yalnızca tek vektörlü (single-vector) modellerle sınırlıdır ve ColBERT benzeri çok vektörlü modern mimarilere doğrudan uygulanamaz.
  • ColNanoVDR ile Dokümansız Çok Vektörlü Mimari: ColNanoVDR, literatürde belgesiz (document-free) sorgu damıtma yaklaşımını çok vektörlü görsel belge erişimine (multi-vector VDR) taşıyan ilk çerçevedir. Bu yaklaşım, doküman sayfalarına ihtiyaç duymadan hafif sorgu modelleri eğitilmesine olanak tanıyarak veri depolama gereksinimlerini sıfırlar.
  • Öğrenilmiş Ağırlıklı Optimal Taşıma (OTW): Çerçevenin sunduğu OTW (Optimal Transport with Learned Weights) hedef fonksiyonu, öğrenci ve öğretmen belirteçlerini entropik optimal taşıma ile hizalar. Her öğrenci belirtecine öğrenilebilir bir ağırlık atayarak iki model arasındaki farklı tokenizasyon yapılarının birebir eşleşme zorunluluğunu ortadan kaldırır.
  • MaxSim Skor Farkı İçin Teorik Hata Sınırı: Geliştiriciler için kritik bir teorik güvence olarak; OTW ile hesaplanan hizalama maliyetinin, taranan her sayfadaki MaxSim puan farkını matematiksel olarak üstten sınırladığı (bounds) ispatlanmıştır. Bu sayede üretim ortamında arama doğruluğu ve skor tutarlılığı teorik olarak garanti edilir.
  • 149M Model ile 26 Kata Varan Hız Artışı: En gelişmiş beş öğretmen modelden damıtılan 149 milyon parametreli sadece-metin (text-only) öğrenci modeller, ViDoRe v1-v3 testlerinde öğretmenlerinin NDCG@5 başarısının yaklaşık %95'ini korumayı başarmıştır. Bunun yanı sıra sorguları 26 kata kadar daha hızlı kodlayarak gerçek zamanlı arama sistemleri için ideal hale gelir.
  • Sıfır Sayfa Kodlama ve 12,6 Kat Veri Verimliliği: OTW mekanizması, özdeş eğitim koşullarında hiçbir doküman sayfasını kodlamadan ve öğretmenden 12,6 kat daha az önbellek verisi okuyarak standart skor damıtımıyla tam başa baş bir performans sunar. Böylece hem eğitim süresini hem de altyapı veri transferini radikal biçimde düşürür.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Embedding Model Serving Temelleri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →