WeVisDoc: Dayanıklı Uçtan Uca Doküman Ayrıştırmada Kapsamdan Yetkinliğe
İçindekiler
Doküman Ayrıştırmanın Zorlukları ve Kapsam Yanılgısı
Doküman ayrıştırma (document parsing), doküman görsellerini yapılandırılmış dijital içeriklere dönüştüren, farklı sayfa düzenleri ve değişken edinim koşulları altında güvenilir performans gerektiren kritik bir yapay zeka görevidir. Ancak mevcut eğitim veri setleri genellikle standart doküman tiplerine ve kusursuz dijital sayfalara odaklanarak belirgin bir yanlılık (bias) barındırır. Yalnızca veri kapsamını niceliksel olarak genişletmek ise ayrıştırıcı modelin kalan zayıflıklarını nasıl gidereceğini belirlemez. Bu temel darboğazı aşmak amacıyla geliştirilen WeVisDoc, dayanıklı uçtan uca doküman ayrıştırma için iki aşamalı ve veri odaklı (data-centric) yeni bir çerçeve sunmaktadır.
İki Aşamalı Veri Odaklı Çerçeve
WeVisDoc mimarisi, genel veri kapsamını genişletmekten hedefe yönelik yetkinlik kazandırmaya uzanan iki temel aşamadan oluşmaktadır:
- Aşama I (Heterojen Kapsam Genişletme): Heterojen veri kaynakları ve dokümanın biçimsel bütünlüğünü bozmayan yapıyı koruyucu bozulma sentezi (structure-preserving degradation synthesis) yoluyla modelin anlamsal, yapısal ve görsel görünüm kapsamını genişletir.
- Aşama II (Hedefe Yönelik Teşhis ve İyileştirme): Sabit görsel-yapısal kümeler içindeki artık hataları (residual errors) ölçmek için ayrılmış bağımsız bir test probu (held-out probe) kullanır; bu tanısal veriler ışığında hedefe yönelik veri inşasını ve hedef token bütçesinin yeniden tahsisini yönetir.
Benchmark Sonuçları ve Başarı Metrikleri
Deneysel değerlendirmeler, WeVisDoc yaklaşımının uçtan uca çözümlerde yeni bir standart belirlediğini kanıtlamaktadır. WeVisDoc-4B, zorlu OmniDocBench v1.6 testinde 95.38 genel skor elde etmiştir. Model ayrıca, PureDocBench'in üç farklı parkurunda ortalama 75.54 genel skora ulaşarak karşılaştırılan tüm uçtan uca ayrıştırıcılar arasında dört değerlendirme ortamının tamamında birinci sıraya yerleşmiştir. Aşama I ile kıyaslandığında Aşama II, hem 2B hem de 4B modellerinin her iki benchmark üzerindeki genel skorlarını belirgin biçimde artırmıştır. En büyük sıçrama bozulmuş PureDocBench parkurlarında kaydedilmiş; 4B modeli Gerçek Bozulmuş (Real Degraded) parkurda 4.03 puanlık net bir kazanım sağlamıştır.
Geliştiriciler İçin Pratik Çıkarımlar
Yazılım mühendisliği ve yapay zeka pratikleri açısından WeVisDoc, salt model parametrelerini büyütmek yerine veri merkezli optimizasyonun gücünü göstermektedir. Doküman işleme boru hatları inşa eden ekipler için çıkarılacak ilk ders, üretim ortamlarındaki kirli ve taranmış belgelerle başa çıkabilmek adına yapıyı koruyan sentetik bozulma simülasyonlarının eğitim sürecine entegre edilmesidir. İkinci olarak, hata analizini yüzeysel doğruluk metrikleri yerine yapısal kümeler bazında ayrılmış test problarıyla yapmak, sistemin zayıf halkalarını nokta atışı tespit etmeyi sağlar. Bu teşhislere dayalı olarak veri toplamak ve token bütçesini yüksek hata veren karmaşık alanlara kaydırmak, maliyet-etkin ve yüksek dayanımlı modeller üretmenin anahtarıdır.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.20423)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →