---
title: "Doküman Erişimi Duyarlı Parçalama (D-RAC): PDF Normalizasyonu ve Çok Modlu Markdown Dönüşümü ile Kurumsal Dokümanların Evrensel İşlenmesi"
url: https://blog.edumints.com/dokuman-erisimi-duyarli-parcalama-d-rac-pdf-normalizasyonu-v-g5qybdmk
category: "LLM"
date: 2026-09-22T09:10:19.322Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.24220
---

# Doküman Erişimi Duyarlı Parçalama (D-RAC): PDF Normalizasyonu ve Çok Modlu Markdown Dönüşümü ile Kurumsal Dokümanların Evrensel İşlenmesi

## Kurumsal Doküman İşleme ve Parçalama Çıkmazı
Kurumsal bilgi tabanlarında çalışan Retrieval-Augmented Generation (RAG) sistemleri; PDF'ler, Word belgeleri, sunumlar ve taranmış evraklar gibi oldukça heterojen doküman formatlarını işlemek zorundadır. Bu dokümanların içerikleri çoğunlukla karmaşık görsel düzenlerin, çok sütunlu sayfaların ve yoğun tabloların arkasında kilitli kalmaktadır. Geleneksel kural tabanlı veri çıkarma ve OCR yaklaşımları okuma sırasını bozmakta, tabloları düzleştirerek anlamsal bağlamı yok etmekte ve başlık hiyerarşisini kaybetmektedir. Buna karşın, ayıklanan ham metin üzerinde tam ajanlı (agentic) parçalama modelleri çalıştırmak ise yüksek token maliyetlerine ve ciddi halüsinasyon risklerine yol açmaktadır.

## D-RAC Yaklaşımı ve Mimarisi
Web Retrieval-Aware Chunking (W-RAC) çerçevesinin tüm doküman formatlarına genişletilmiş bir versiyonu olan **Document Retrieval-Aware Chunking (D-RAC)**, bu sorunları aşmak için deterministik ve iki aşamalı bir mimari sunmaktadır:
- **PDF Tabanlı Normalizasyon:** Neredeyse her doküman formatının aslına sadık ve deterministik bir PDF çıktısı üretebilmesi gerçeğinden yararlanarak, tüm girdi formatları öncelikle PDF olarak standartlaştırılır.
- **Çok Modlu Markdown Dönüşümü:** Tek bir çok modlu (multimodal) LLM geçişi ile taranan sayfalar erişime optimize edilmiş Markdown'a dönüştürülür. Bu aşamada tablolar, bağımsız nesir ifadelere (self-contained prose statements) dönüştürülerek yeniden yazılır ve başlık hiyerarşisi eksiksiz korunur.
- **Tanımlayıcı (ID) Tabanlı Hafif Parçalama:** Parçalama aşaması doğrudan kaynak metin üzerinden değil, W-RAC yönteminde olduğu gibi kimlik atanabilir (ID-addressable) birimler üzerinden hafif bir LLM planlayıcısı ile yürütülür. Kaynak metin parçalama sırasında asla yeniden üretilmez.

## Benchmark ve Performans Sonuçları
Beş farklı kurumsal alanı kapsayan 236 doküman ve 795 sayfalık RAG-Multi-Corpus PDF veri seti üzerinde yapılan testlerde D-RAC şu sonuçları elde etmiştir:
- Külliyatın tamamı 72 dakika içinde sıfır hatayla işlenmiş ve erişime hazır 1.748 parça (chunk) üretilmiştir.
- Öncü (frontier) LLM'lerle yapılan ajanlı parçalamaya kıyasla çıktı token'larında **%95,7** oranında azalma sağlanmıştır.
- Parçalama maliyetleri GPT-4.1 fiyatlandırmasında **%77,8**, Gemini 2.5 Pro fiyatlandırmasında ise **%85,6** oranında düşürülmüştür.
- Parçalama süresi **%75** kısalırken, sistem 500+ sayfalık devasa dokümanlarda doğrusal (lineer) ölçeklenebilirlik sergilemiştir.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- **Girdi Standardizasyonu:** Üretim ortamlarında heterojen dosya türlerini tek tek ayrıştırmak yerine PDF'e normalize etmek, boru hattı karmaşıklığını ve bakım yükünü ciddi oranda azaltır.
- **Tabloları Nesre Dönüştürme:** Vektör aramalarında tabloları düz metin yerine kendi kendine yeten cümleler olarak indekslemek, semantik benzerlik yakalama başarısını artırır.
- **Kimlik Üzerinden Planlama (ID-Planning):** LLM'e metni baştan yazdırmak yerine ID'ler üzerinden planlama yaptırmak; halüsinasyon riskini sıfırlar, determinizm sağlar ve token maliyetlerini minimize eder.

Orijinal makaleye [buradan](https://huggingface.co/papers/2609.24220) ulaşabilirsiniz.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.24220)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/dokuman-erisimi-duyarli-parcalama-d-rac-pdf-normalizasyonu-v-g5qybdmk
