---
title: "Unlimited-OCR: Tek Seferde Çok Sayfalı Doküman Çözümleme Dönemi"
url: https://blog.edumints.com/unlimited-ocr-tek-seferde-cok-sayfali-dokuman-cozumleme-done-ccku7r66
category: "LLM"
date: 2026-06-24T09:06:25.816Z
publisher: Edumints Blog
lang: tr-TR
source_name: "GitHub"
source_url: https://github.com/baidu/Unlimited-OCR
---

# Unlimited-OCR: Tek Seferde Çok Sayfalı Doküman Çözümleme Dönemi

**Unlimited-OCR**, teknoloji devi Baidu tarafından açık kaynak olarak paylaşılan ve uzun soluklu, çok sayfalı dokümanların tek bir seferde (one-shot) çözümlenmesini sağlayan yenilikçi bir optik karakter tanıma modelidir. Geleneksel OCR sistemleri veya LLM (Büyük Dil Modeli) tabanlı görsel-dil modelleri, uzun dokümanları işlerken doğrusal olarak artan KV (Key-Value) önbellek ihtiyacı sebebiyle bellek yetersizliği (OOM) hataları vermekteydi. Unlimited-OCR ise bu sınırlamayı tamamen ortadan kaldırarak geliştiricilere büyük bir esneklik sunuyor.

Projenin geliştirici topluluğunda bu denli popüler olmasının ve kısa sürede binlerce yıldız toplamasının arkasında **Reference Sliding Window Attention (R-SWA)** adı verilen özgün bir dikkat mekanizması yatar. R-SWA mimarisi sayesinde, model kaç sayfa işlerse işlesin KV önbellek boyutunu sabit tutar. Böylece tüketici seviyesindeki ekran kartlarında dahi 40 sayfadan fazla uzunluktaki dokümanlar tek bir adımda, bellek hatası yaşanmadan analiz edilebilir. Geliştiricilere sunulan **3 milyar parametreli (3B)** bu kompakt model, hem yüksek doğruluk oranı hem de yerel donanımlarda çalışabilme esnekliği sunarak büyük bir maliyet avantajı sağlamaktadır. Özellikle veri gizliliği hassasiyeti olan projeler için yerel kurulum imkanı paha biçilemez bir değer katmaktadır.

## Nasıl Kullanılır?
Unlimited-OCR, geliştiricilerin alışkın olduğu popüler kütüphanelerle uyumlu çalışır. Modeli Hugging Face `transformers` veya yüksek performanslı çıkarım motoru `SGLang` kullanarak projelerinize entegre edebilirsiniz. Aşağıda Python ile temel bir kullanım örneği yer almaktadır:

- **Hugging Face Entegrasyonu:**
```python
from transformers import AutoModelForCausalLM, AutoProcessor

model_id = "baidu/Unlimited-OCR"
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True)
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

# Çok sayfalı belgenin sayfalarını hazırlayın
inputs = processor(images=pages, text="Metni çıkarın:", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=4096)
print(processor.decode(outputs[0]))
```

Ayrıca modelin GGUF formatındaki sürümleri sayesinde, yerel bilgisayarlarda `llama.cpp` aracılığıyla CPU/GPU üzerinde optimize edilmiş şekilde çalıştırılması da mümkündür.

## Benzer Araçlarla Karşılaştırma
Unlimited-OCR, pazardaki diğer alternatiflerle karşılaştırıldığında belirgin üstünlüklere sahiptir:

- **PaddleOCR ile Karşılaştırma:** Baidu'nun bir diğer popüler kütüphanesi olan PaddleOCR, tek sayfalık belgeler ve kelime tespiti için başarılı olsa da, çok sayfalı belgelerin sayfa yapısını koruyarak anlamlı metin üretme (parsing) konusunda Unlimited-OCR'ın gerisinde kalır.
- **Tesseract OCR ile Karşılaştırma:** Tesseract, karmaşık sayfa düzenleri ve el yazısı içeren belgelerde düşük doğruluk verirken; Unlimited-OCR, gelişmiş yapay zeka yetenekleriyle karmaşık tabloları ve grafikli raporları dahi kusursuz çözer.
- **Bulut API'leri (Google Vision, AWS Textract):** Bulut servisleri sayfa başına ücretlendirme yapar ve veri gizliliği riski barındırır. Unlimited-OCR ise tamamen yerel ve ücretsiz bir çözüm sunar.

Orijinal repoya [buradan](https://github.com/baidu/Unlimited-OCR) ulaşabilirsiniz.

---

**Kaynak:** [GitHub](https://github.com/baidu/Unlimited-OCR)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/unlimited-ocr-tek-seferde-cok-sayfali-dokuman-cozumleme-done-ccku7r66
