XingChen-AGI/TeleOCR — Hugging Face'te Öne Çıkan Çok Modlu Belge Ayrıştırma Modeli
İçindekiler
Hugging Face ekosisteminde geliştiricilerin dikkatini çeken XingChen-AGI/TeleOCR, görsel ve metin modalitelerini birleştiren, özellikle belge ayrıştırma (document parsing) ve optik karakter tanıma (OCR) alanında optimize edilmiş açık ağırlıklı bir yapay zeka modelidir. Günümüz modern yapay zeka uygulamalarında taranmış belgelerin, makbuzların ve teknik dokümanların anlamlandırılması kritik bir ihtiyaçtır. TeleOCR, popüler Qwen mimarisine dayanan yapısıyla bu alanda güçlü bir alternatif sunmaktadır.
Model Profili ve Temel Özellikler
Modelin Hugging Face üzerindeki dağıtım metrikleri ve yapılandırma bilgileri şu şekildedir:
- İndirme ve Beğeni: Model, 27.837 anlık indirme (toplamda 39.391 tüm zamanlar indirmesi) ve 627 beğeni sayısıyla topluluk nezdinde geniş bir kabul görmüştür.
- Mimari Altyapı: Temelinde
qwen2_5_vlvizyon-dil omurgasını barındıran model,transformerskütüphanesi ve modernsafetensorsağırlık depolama formatı ile tam uyumludur. - Etiket Kapsamı: Ekosistem üzerinde
transformers,safetensors,qwen2_5_vl,image-text-to-text,ocr,document-parsing,multimodalveconversationaletiketleriyle indekslenmiştir.
Şablon Mimarisi ve İstem Yapısı
TeleOCR, Jinja formatındaki sohbet şablonu (chat_template_jinja) sayesinde görsel ve video girdilerini standart ChatML benzeri bir yapıyla yönetir:
- Sistem İletisi Katmanı: Diyalog başlangıcında otomatik olarak sistem mesajı enjekte edilir.
- Görsel Belirteç Ayrıştırması: Girdi olarak verilen görseller için sayaç tabanlı bir mekanizma işletilerek
|vision_start|> |image_pad|> |vision_end|>özel belirteçleri dinamik biçimde yerleştirilir. - Video Giriş Yönetimi: Çok kareli video girdileri de özel vizyon blokları içerisine alınarak çok modlu bağlam korunur.
- Üretim Tetiği: İstem sonuna eklenen
|im_start|>assistantbelirteci ile modelin çıkarım süreci başlatılır.
ParseBench Değerlendirme Sonuçları
LlamaIndex ekibinden Boyang Zhang tarafından hazırlanan standart ParseBench değerlendirmesinde model, teleocr_vllm çıkarım boru hattı üzerinden test edilmiş ve 3 temel metrik elde edilmiştir:
- Mean (Genel Ortalama Başarım): Model, ParseBench üzerinde 58.67 ortalama skor elde ederek liderlik tablosunda 12. sıraya yerleşmiştir.
- Text Content (Metin İçeriği Çıkarımı): 85.39 başarım puanı ve 16. sıra derecesiyle doküman içerisindeki ham karakterlerin, kelimelerin ve metin bloklarının yüksek doğrulukla çıkarıldığını kanıtlamıştır.
- Text Formatting (Metin Biçimlendirme): Yapısal düzen, tablo hiyerarşisi ve biçimlendirme doğruluğunda 45.13 puan elde etmiş; karmaşık mizanpajlarda iyileştirmeye açık noktalar olduğunu göstermiştir.
Yazılım Geliştiricileri İçin Pratik Çıkarımlar
Uygulama geliştirme ve RAG (Retrieval-Augmented Generation) mimarileri açısından model şu önemli çıkarımları sunar:
- vLLM ile Hızlı Çıkarım:
teleocr_vllmdesteği sayesinde yüksek eşzamanlı üretim ortamlarında optimize bir şekilde sunulabilir. - Ham Metin Ayrıştırma Başarımı: %85'i aşan metin içeriği doğruluğu, fatura veya taranmış evraklardan veri çekmek için fazlasıyla yeterlidir.
- Biçimsel Doğrulama İhtiyacı: Biçimlendirme skorunun düşüklüğü sebebiyle, karmaşık tablo ve şablon analizlerinde model çıktısının yapılandırılmış JSON veya regex katmanlarıyla desteklenmesi tavsiye edilir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →