LLM·2 dk okuma·
Paragraf Sınırları Yalnızca Boşluktan İbaret Değildir: Hiyerarşik Yapının İmzası Olarak Sıkıştırma Derinliği
LLMEdumints Blog
İçindekiler
Giriş ve Genel Bakış
Geleneksel büyük dil modellerinde metin dizilimleri çoğunlukla tek boyutlu ve doğrusal bir okuma sırasına göre temsil edilir. Oysa doğal dil metinleri; paragraflar, cümleler ve alt belirteçlerden oluşan çok katmanlı, hiyerarşik bir mimari barındırır. Yapılan güncel araştırma, paragraf sınırlarının yalnızca görsel birer boşluk karakterinden ibaret olmadığını; modelin dikkat mekanizmasında (attention) ölçülebilir ve ayırt edici bir hiyerarşik derinlik inşa ettiğini ampirik olarak göstermektedir.
Araştırmanın Temel Bulguları
Makalede sunulan hiyerarşik yapı analizi altı temel aşama ve bulgudan oluşmaktadır:
- Doğrusal Pozisyonel Kodlamanın Yetersizliği: Standart konumsal kodlamalar belirteçlerin konumunu tek boyutlu bir okuma sırası koordinatı olarak modeller; ancak salt okuma sırası metnin hiyerarşik yapısını belirlemeye yetmez.
- hRoPE Mimarisi ve Müdahale: Paragraf, cümle ve belirteç indekslerini bağımsız kanallarda temsil eden hiyerarşik döner konumsal kodlama (hRoPE) kullanılmıştır. Belirteç dizisi sabit tutularak ilk paragraf koordinatına ($p_1$) müdahale edilmiş ve paragraflar arası dikkat mekanizması belirteç-mesafesi duyarlı bir tahminleyici ile ölçülmüştür.
- Sıkıştırma ve Kontrol Mekanizması: İncelenen her derlemde (corpus), belirteç mesafesi eşleştirilmiş bir referansa göre dikkat değerlerinde sıkışma gözlemlenmiştir. Ancak tek başına sıkışma gerçek yapıyı kanıtlamaz; zira mimari olarak özdeş ve yoğunluğu eşleştirilmiş rastgele etiketler de sığ bir sıkışma sergilemektedir.
- Sıkıştırma Derinliğinin Ayırt Ediciliği: Gerçek metin hiyerarşisini sahte yapılardan ayıran asıl kriter sıkıştırma derinliğidir (compression depth). Bu derinlik gerçek yapı içeren metinlerde belirgin biçimde daha fazladır ve derlemin doğasına göre değişiklik gösterir; kontrol grubunda ise derlemden bağımsızdır.
- Derlem Metrikleri ve Tutarlılık: Sözcüksel kalıcılık, paragraf uzunluğu ve embedding tabanlı tutarlılık olmak üzere üç yapı altındaki sekiz derlem niceliği kıyaslandığında; hiçbiri derinliğin derlemler arası sıralamasını tam olarak yansıtamamış, fakat embedding tabanlı tutarlılık bu sıralamaya en çok yaklaşan ölçüt olmuştur.
- Hiyerarşik Yapının İmzası: Çalışmanın ortaya koyduğu en temel sonuç, sıkıştırmanın nerede gerçekleştiğinin değil; sıkıştırma derinliğinin, hakiki paragraf hiyerarşisinin yinelenebilir ve tutarlı bilimsel imzası olduğudur.
Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
- Akıllı Metin Bölme (Chunking): RAG (Retrieval-Augmented Generation) mimarilerinde metinleri sabit karakter uzunluğuyla rastgele bölmek, modelin hiyerarşik dikkat derinliğini yok eder. Paragraf sınırlarını koruyan semantik chunking stratejileri benimsenmelidir.
- Embedding Tabanlı Doğrulama: Metin tutarlılığını ve bölüm sınırlarını değerlendirirken salt sözcük sıklığı yerine embedding tabanlı anlamsal tutarlılık metriklerini kullanmak daha yüksek kaliteli bilgi alımı (retrieval) sağlar.
- Model Mimarisi ve Bağlam Optimizasyonu: Uzun bağlamlı LLM geliştirirken hRoPE benzeri çok kanallı hiyerarşik konumsal kodlamalar entegre etmek, belgeler arası ve paragraflar arası mantıksal ilişkilerin çok daha derin işlenmesine olanak tanır.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →