---
title: "CoVeR: Görsel Dil Modellerinde Çok Açılı 3B Akıl Yürütme İçin Kapsama Tabanlı Token Budama"
url: https://blog.edumints.com/cover-gorsel-dil-modellerinde-cok-acili-3b-akil-yurutme-icin-lv6gnu7h
category: "Makine Öğrenmesi"
date: 2026-09-09T09:08:25.016Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.08345
---

# CoVeR: Görsel Dil Modellerinde Çok Açılı 3B Akıl Yürütme İçin Kapsama Tabanlı Token Budama

## Çok Açılı 3B Akıl Yürütme ve Artan Hesaplama Maliyeti

3 boyutlu (3B) sahneleri çok açılı (multi-view) 2B görüntülerle temsil etmek, 2B Görsel Dil Modellerinin (VLM) önceden eğitilmiş güçlü görsel temsillerini 3B uzayda doğrudan yeniden kullanmasına imkân tanır. Bu strateji, etiketli 3B veri kıtlığı problemini aşmak için etkili bir yoldur. Ancak eklenen her yeni kamera açısı, sahneye ait binlerce gereksiz görsel token üretir ve modelin hesaplama ile çıkarım (inference) maliyetini katlayarak artırır.

## Mevcut Görsel Token Budayıcıların Sınırları

Literatürdeki mevcut görsel token budama yöntemleri iki temel aileye ayrılmaktadır; ancak her ikisi de çok açılı 3B senaryolarda belirgin kısıtlamalara sahiptir:

- **Öğrenilmiş Önem (Learned Importance) Yöntemleri:** Token'ları dikkat (attention) ağırlıklarına veya kodlayıcı özniteliklerine göre derecelendirir. Çok açılı senaryolardaki veri fazlalığı temelde mekânsal olduğu için, bu yöntemler sadece birkaç baskın bölgeden neredeyse birbirinin kopyası olan token'ları seçer ve sahnenin büyük bir kısmını temsilsiz bırakır.
- **Vokselizasyon (Voxelization) Yöntemleri:** Mekânsal kapsamayı artırır ancak kesin bir token bütçesini zorlayamaz. Çok açılı gözlemler 3B uzayda üst üste bindikçe doygunluk (saturation) platosuna ulaşır ve hedeflenen bütçenin çok altında token tutulmasına neden olur.

## CoVeR: Eğitimsiz ve Deterministik Kapsama Çözümü

Yapılan araştırmalar, mekânsal kapsama düzeyinin 3B akıl yürütme performansı ile doğrudan ilişkili olduğunu göstermektedir. Bu doğrultuda geliştirilen **CoVeR**, öğrenilmiş hiçbir ağırlık veya sinyal kullanmadan, yalnızca token koordinatlarına dayanan deterministik ve eğitimsiz bir seçicidir.

CoVeR, sahnenin her bölgesini toplu olarak kapsayan token'ları seçer ve önceki iki yaklaşımın kısıtlamalarını çözer:
- Sahne başına kesin bir token bütçesi uygular.
- Vokselizasyonun doygunluk platosunu aşar.
- Öğrenilmiş önem yöntemlerinin yarattığı birbirini tekrarlayan token seçimlerini engeller.

## Benchmark Başarımı ve Tak-Çalıştır Uyumluluk

Kapsamlı deneyler, CoVeR'ın her üç 3B akıl yürütme kıyaslama testinde (benchmark) mevcut en gelişmiş yöntemleri (SOTA) geride bıraktığını göstermektedir. Dört farklı VLM üzerinde başarıyla test edilen yöntem, genel geçer ve tak-çalıştır bir eklenti olarak çalışır:
- **Yüksek Sıkıştırma ve Başarım:** Yalnızca yaklaşık %8 görsel token kullanarak tam token başarımının %93,5'ini korur.
- **SOTA Üstünlüğü:** Kıyaslama testlerinde önceki SOTA yöntemlere kıyasla ortalama 3,9 yüzdelik puan daha yüksek başarım sergiler.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

Büyük ölçekli çok modlu sistemler geliştiren mühendisler için bu mimari şu pratik kazanımları sunar:
- **Sıfır Ek Eğitim:** Modeli yeniden eğitmeye veya GPU üzerinde karmaşık dikkat hesaplamalarına gerek kalmadan doğrudan inference hattına entegre edilebilir.
- **Öngörülebilir Bellek ve Kaynak Yönetimi:** Kesin token bütçesi dayatabilmesi sayesinde KV-cache ve GPU VRAM tüketimi deterministik olarak yönetilebilir.
- **Düşük Gecikme:** Token sayısını %92 oranında azaltarak çok açılı görsel çıkarımlarda uçtan uca gecikmeyi (latency) dramatik şekilde düşürür.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.08345)](https://huggingface.co/papers/2609.08345)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.08345)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/cover-gorsel-dil-modellerinde-cok-acili-3b-akil-yurutme-icin-lv6gnu7h
