NeoMME: Verimli, Doğal Çok Modlu ve Çok Dilli Enkoder
İçindekiler
TL;DR
Hcompany tarafından geliştirilen NeoMME, 260M ve 800M parametreli iki modelden oluşan çok dilli ve çok modlu yeni nesil bir enkoder ailesidir. Üretken görsel dil modellerinin (VLM) aksine NeoMME, harici bir görsel kule (vision tower) veya nedensel (causal) dil modeli kullanmaz. Bunun yerine, tek bir çift yönlü (bidirectional) Transformer mimarisi hem metin belirteçlerini (token) hem de ham görsel yamalarını (patch) doğrudan işler. Model sıfırdan maskelenmiş ayrık difüzyon hedefiyle eğitilmiştir. Görsel belge erişimi için ColPali yaklaşımıyla ince ayarı yapılan NeoMME-Retriever; tek bir ileri geçişte hem yoğun (dense) hem de geç etkileşimli (late-interaction) vektör temsilleri üretir. ViDoRe v3 testlerinde Pareto sınırında yer alan 260M modeli, NVIDIA L40S üzerinde saniyede yaklaşık 51 sayfa işleyerek ColModernVBERT'in iki katı işlem hacmi sunar. Ayrıca hiyerarşik token havuzlama ve asimetrik kuantizasyon sayesinde, indeks depolama boyutu sayfa başına 1,5 MB'tan 6 kB'a (%99'un üzerinde küçülme) düşürülürken nDCG@10 başarısının %95'inden fazlası korunur. Model, Apache 2.0 açık kaynak lisansıyla Hugging Face Transformers üzerinde yayınlanmıştır.
Neden Yeni Bir Çok Modlu Enkoder?
Güncel görsel belge arama sistemleri genellikle önceden eğitilmiş üretken VLM'lerden uyarlanır. Bu mimarilerde bağımsız bir görüntü kodlayıcı görsel özellikleri çıkarır, bir projeksiyon katmanı bu özellikleri dil modelinin uzayına aktarır ve nedensel bir kod çözücü (causal decoder) birleşik temsilleri işler. Oysa bilgi getirme (retrieval), sınıflandırma ve token etiketleme gibi görevler metin üretimi yapmadığından nedensel bir dekodere ya da bu yapının getirdiği parametre ve hesaplama yüküne ihtiyaç duymaz. ModernBERT çift yönlü enkoderlere mimari verimlilik kazandırmış, ModernVBERT ise bu yaklaşımı SigLIP2 görsel kulesi ile sürdürmüştür. NeoMME bu sınırı aşarak bir VLM'in getirdiği tüm hesaplama ve parametre fazlalıklarını ortadan kaldırır. "Nee-oh-me" olarak okunan model; önceden eğitilmiş harici bir görsel kule, metin kodlayıcı veya dekodere dayanmaz. Görüntü yamalarını ve metin token'larını tek bir çift yönlü Transformer içinde aynı hesaplama yoluyla işler. Bu birleşik mimari; ön eğitim, ince ayar, paralelleştirme ve canlı ortamda sunum (serving) süreçlerini mühendislik açısından büyük ölçüde kolaylaştırır.
NeoMME Omurgası: Görseller ve Metin İçin Tek Transformer
NeoMME, 260M ve 800M olmak üzere iki boyutta sunulur ve her iki model de aynı temel mimariyi paylaşır:
- Doğal çok modlu girdiler (Native multimodal inputs): Metin girdileri çarpanlara ayrılmış token gömmeleri kullanırken, görseller örtüşmeyen 32×32 piksellik yamalara ayrılır ve küçük bir MLP ile yansıtılır. Her iki girdi türü de aynı Transformer enkoderine aktarılır.
- Dinamik görsel çözünürlüğü (Dynamic image resolution): Görseller orijinal en-boy oranlarını ve boyutlarını korur. Bu esneklik, doküman düzeninin bozulmasını engelleyerek modelin görsel öğeleri kayıpsız işlemesine imkân tanır.
Yazılım geliştirme ve görsel RAG boru hatları açısından NeoMME; OCR gibi kırılgan ön işleme adımlarını devre dışı bırakır, ColPali tarzı geç etkileşimli aramayı 255 kat daha küçük indeks boyutlarıyla sunar ve kurumsal arama sistemlerinde bellek ile altyapı maliyetlerini radikal biçimde optimize eder.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Embedding Model Serving Temelleri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →