LFM2.5-VL-DSpark ile Görme-Dil Modellerini Hızlandırma
İçindekiler
LiquidAI, 3 milyar parametreli görme-dil modeli (VLM) LFM2.5-VL-3B için deneysel DSpark taslak modelini (drafter) duyurdu. Yakın zamanda yayımlanan metin tabanlı LFM2.5-DSpark modellerinde olduğu gibi bu mimari, çıktı kalitesinden ödün vermeksizin minimum bellek artışıyla çok daha yüksek çıkarım (inference) hızları sunan bir spekülatif kod çözme (speculative decoding) yaklaşımı getiriyor.
Öne çıkan kazanımlar:
- Daha hızlı çıkarım: Cihaz üzerinde 3,13 kata, H100 GPU üzerinde 2,66 kata varan kod çözme hızlanması; uçtan uca gecikmede sırasıyla 2,62 kat ve 2,27 kata kadar kazanç.
- Düşük bellek maliyeti: Taslak model, 3B hedef modele yalnızca 280M parametre ekleyerek bellek ayak izini sadece %8,9 artırır.
- İlk günden entegrasyon desteği: llama.cpp, MLX-VLM ve SGLang için LFM uyumlu hazır DSpark entegrasyonları.
Görme-Dil Modellerinde (VLM) Spekülatif Kod Çözme Nasıl Çalışır?
Görsel taslak modeli, metin tabanlı DSpark mimarisiyle aynı yapıyı kullanır: Hedef modelin belirli katmanlarındaki gizli durumları (hidden states) yakalar ve bunlara koşullanarak k aday tokenden oluşan bloklar üretir. Görüntü yamaları (image patches) ve metin token'ları bu katmanlardan önce ortak bir temsile yansıtıldığından, taslak model girdi modalitesine bakılmaksızın özdeş boyutlu vektörler üzerinde işlem yapar. Böylece çıkarım algoritması metin modelleriyle birebir aynı kalır.
Eğitim ve Mimari
Model, beklenen iş yüklerine göre ağırlıklandırılmış görme-dil SFT veri karışımıyla eğitilmiştir. 3, 4 ve 5 katmanlı denemelerin (ablasyon) ardından, 4 katmanlı ve 9 blok boyutuna sahip, yalnızca dikkat (attention-only) mekanizması içeren basitleştirilmiş bir taslak model seçilmiştir. 10 epoch eğitilen modelde, çıkarım anında donanıma bağlı olarak 8 veya 9 blok boyutu önerilmektedir.
| Bileşen | LFM2.5-VL-3B |
|---|---|
| Kod çözücü yığını (Decoder stack - 4 katman) | 193.0M |
| Gizli durum projeksiyonu (Hidden-state projection) | 21.0M |
| Markov başlığı (Markov head) | 65.5M |
| Normalizasyonlar + güven başlığı (Norms + confidence head) | 6.4k |
| Toplam | 279.5M |
CPU ve GPU Üzerinde Çıkarım Hızlanması
Blok boyutu 8 olarak ayarlanıp MMSpec karşılaştırmasındaki altı farklı görevde (genel VQA, metin VQA, görsel betimleme, grafik VQA, karmaşık akıl yürütme, çok turlu diyalog) test edilmiştir:
- Cihaz üzerinde çıkarım: Apple M5 Max (MLX) ile kod çözme 2,30x - 3,13x, uçtan uca gecikme 1,56x - 2,62x hızlanmıştır. M3 Ultra (llama.cpp) ile kod çözmede 1,57x - 2,14x, uçtan uca gecikmede 1,30x - 1,77x kazanç sağlanmıştır.
- GPU üzerinde çıkarım: H100 üzerinde 2,04x - 2,66x daha hızlı kod çözme ve 1,64x - 2,27x uçtan uca iyileşme elde edilmiştir.
Görme İş Yüklerinde Spekülasyonun Sınırları ve Geliştirici Çıkarımları
Büyük dil modellerinde ön doldurma (prefill) aşaması işlem gücüne bağımlıdır (compute-bound). Görme-dil modellerinde ise görsel kodlayıcı yüzlerce görsel token ürettiğinden prefill yükü katlanarak artar. Uç cihazlardaki sınırlı hesaplama kapasitesi nedeniyle prefill aşaması belirgin bir darboğaza dönüşebilir.
Geliştiriciler için pratik çıkarım: Bellek bütçesine yalnızca %8,9 ek maliyet getirerek doğruluk kaybı yaşamadan 2-3 kat hız artışı elde etmek; SGLang ve llama.cpp gibi ortamlarda servis maliyetlerini ve gecikmeyi (latency) düşürmek için son derece etkilidir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →