LLM·3 dk okuma·

XingChen-AGI/TeleOCR — Hugging Face'te Öne Çıkan Çok Modlu Belge Ayrıştırma Modeli

Paylaş
LLMEdumints Blog

Hugging Face ekosisteminde geliştiricilerin dikkatini çeken XingChen-AGI/TeleOCR, görsel ve metin modalitelerini birleştiren, özellikle belge ayrıştırma (document parsing) ve optik karakter tanıma (OCR) alanında optimize edilmiş açık ağırlıklı bir yapay zeka modelidir. Günümüz modern yapay zeka uygulamalarında taranmış belgelerin, makbuzların ve teknik dokümanların anlamlandırılması kritik bir ihtiyaçtır. TeleOCR, popüler Qwen mimarisine dayanan yapısıyla bu alanda güçlü bir alternatif sunmaktadır.

Model Profili ve Temel Özellikler

Modelin Hugging Face üzerindeki dağıtım metrikleri ve yapılandırma bilgileri şu şekildedir:

  • İndirme ve Beğeni: Model, 27.837 anlık indirme (toplamda 39.391 tüm zamanlar indirmesi) ve 627 beğeni sayısıyla topluluk nezdinde geniş bir kabul görmüştür.
  • Mimari Altyapı: Temelinde qwen2_5_vl vizyon-dil omurgasını barındıran model, transformers kütüphanesi ve modern safetensors ağırlık depolama formatı ile tam uyumludur.
  • Etiket Kapsamı: Ekosistem üzerinde transformers, safetensors, qwen2_5_vl, image-text-to-text, ocr, document-parsing, multimodal ve conversational etiketleriyle indekslenmiştir.

Şablon Mimarisi ve İstem Yapısı

TeleOCR, Jinja formatındaki sohbet şablonu (chat_template_jinja) sayesinde görsel ve video girdilerini standart ChatML benzeri bir yapıyla yönetir:

  • Sistem İletisi Katmanı: Diyalog başlangıcında otomatik olarak sistem mesajı enjekte edilir.
  • Görsel Belirteç Ayrıştırması: Girdi olarak verilen görseller için sayaç tabanlı bir mekanizma işletilerek |vision_start|> |image_pad|> |vision_end|> özel belirteçleri dinamik biçimde yerleştirilir.
  • Video Giriş Yönetimi: Çok kareli video girdileri de özel vizyon blokları içerisine alınarak çok modlu bağlam korunur.
  • Üretim Tetiği: İstem sonuna eklenen |im_start|>assistant belirteci ile modelin çıkarım süreci başlatılır.

ParseBench Değerlendirme Sonuçları

LlamaIndex ekibinden Boyang Zhang tarafından hazırlanan standart ParseBench değerlendirmesinde model, teleocr_vllm çıkarım boru hattı üzerinden test edilmiş ve 3 temel metrik elde edilmiştir:

  • Mean (Genel Ortalama Başarım): Model, ParseBench üzerinde 58.67 ortalama skor elde ederek liderlik tablosunda 12. sıraya yerleşmiştir.
  • Text Content (Metin İçeriği Çıkarımı): 85.39 başarım puanı ve 16. sıra derecesiyle doküman içerisindeki ham karakterlerin, kelimelerin ve metin bloklarının yüksek doğrulukla çıkarıldığını kanıtlamıştır.
  • Text Formatting (Metin Biçimlendirme): Yapısal düzen, tablo hiyerarşisi ve biçimlendirme doğruluğunda 45.13 puan elde etmiş; karmaşık mizanpajlarda iyileştirmeye açık noktalar olduğunu göstermiştir.

Yazılım Geliştiricileri İçin Pratik Çıkarımlar

Uygulama geliştirme ve RAG (Retrieval-Augmented Generation) mimarileri açısından model şu önemli çıkarımları sunar:

  • vLLM ile Hızlı Çıkarım: teleocr_vllm desteği sayesinde yüksek eşzamanlı üretim ortamlarında optimize bir şekilde sunulabilir.
  • Ham Metin Ayrıştırma Başarımı: %85'i aşan metin içeriği doğruluğu, fatura veya taranmış evraklardan veri çekmek için fazlasıyla yeterlidir.
  • Biçimsel Doğrulama İhtiyacı: Biçimlendirme skorunun düşüklüğü sebebiyle, karmaşık tablo ve şablon analizlerinde model çıktısının yapılandırılmış JSON veya regex katmanlarıyla desteklenmesi tavsiye edilir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →