---
title: "Log-Lineer Karmaşıklık ile Blok Seyrek Dikkat: PISA Mimarisi"
url: https://blog.edumints.com/log-lineer-karmasiklik-ile-blok-seyrek-dikkat-pisa-mimarisi-w9b009ce
category: "LLM"
date: 2026-09-28T09:11:50.329Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.31093
---

# Log-Lineer Karmaşıklık ile Blok Seyrek Dikkat: PISA Mimarisi

## Giriş ve Problem Tanımı
Büyük dil modellerinde (LLM) bağlam penceresini uzatmak, standart **öz-dikkat (self-attention)** mekanizmasının karesel hesaplama maliyeti ($O(N^2)$) nedeniyle ciddi bir ölçekleme engeline takılmaktadır. Dizi uzunluğu arttıkça her belirtecin diğer tüm belirteçlerle eşleşmesi bellek ve işlemci üzerinde büyük bir yük oluşturur. Blok seyrek dikkat (block sparse attention) yaklaşımları bu maliyeti düşürmek için etkili bir alternatif sunsa da, korunacak blokların seçimi temel bir darboğaz oluşturmaktadır. Geleneksel blok seçimi yöntemleri tüm sorgu-blok (query-block) çiftlerinin skorlanmasını gerektirir; bu durum bloklama yapılsa dahi seçim aşamasının dizi uzunluğuna göre karesel kalmasına yol açar.

## PISA ve Piramit Top-K Seçim Stratejisi
Bu kısıtlamayı ortadan kaldırmak amacıyla, piramit Top-K seçim stratejisini kullanan **PISA** (Pyramid Top-K Block Sparse Attention) mimarisi önerilmektedir. Temel fikir, aday anahtarları (keys) farklı seviyeler boyunca kademeli biçimde daraltarak en ilgili olanları yüksek hesaplama verimliliğiyle belirlemektir.

PISA mimarisinin sunduğu temel teknik adımlar şunlardır:
- **Kabadan İnceye Hiyerarşi**: Anahtarlar için kabadan inceye doğru seviyelendirilmiş bir yapı kurulur ve aday arama süreci en kaba düzeyden başlatılır.
- **LogSumExp ile Kademeli Skorlama**: Her düzeyde, LogSumExp skorlaması yalnızca sınırlandırılmış bir aday kümesine uygulanır ve seçilen adaylar bir sonraki daha ince düzeye aktarılır. Bu döngü en ince seviyeye ulaşılana dek sürdürülür.
- **$O(N \log N)$ Hesaplama Karmaşıklığı**: Havuzlama (pooling) yöntemleriyle $O(\log N)$ sayıda anahtar seviyesi inşa edilir; böylece genel hesaplama karmaşıklığı karesel düzeyden log-lineer seviyeye ($O(N \log N)$) indirilir ($N$ dizi uzunluğunu ifade eder).
- **Donanım Uyumlu Triton Kernel'leri**: Model eğitimi ve çıkarım (inference) süreçleri için hiyerarşik yönlendirmeyi ve LogSumExp skorlamasını birleştiren (fused) özel Triton kernel'leri geliştirilmiştir. Böylece devasa sorgu-anahtar matrisi bellekte fiziksel olarak oluşturulmaz (materialize edilmez).
- **Model Başarımı ve Benchmark Sonuçları**: Dil modelleme kıyaslamalarında değerlendirilen yöntem; sağduyusal akıl yürütme (commonsense reasoning) görevlerinde standart modellerle başa baş performans gösterirken, bilgi getirme (retrieval) testlerinde daha üstün sonuçlar elde etmiştir.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- **Kernel Füzyonu ve VRAM Optimizasyonu**: Triton ile kernel seviyesinde yapılan füzyon, ara matrislerin GPU belleğine yazılmasını engelleyerek bellek transfer maliyetini düşürür ve çıkarım hızını artırır.
- **Büyük Ölçekli Sistem Mimarisi**: $O(N \log N)$ karmaşıklığı, uzun metinleri işleyen RAG ve doküman analizi pipeline'larında donanım maliyetlerini ve yanıt gecikmelerini (latency) ciddi oranda azaltır.
- **Hiyerarşik Budama Stratejisi**: Kabadan inceye aday daraltma mantığı, yazılım mimarilerindeki indeksleme sistemleriyle doğrudan örtüşür; büyük veri kümelerinde erken budamanın (early pruning) kritik önemini doğrular.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.31093)](https://huggingface.co/papers/2609.31093)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.31093)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/log-lineer-karmasiklik-ile-blok-seyrek-dikkat-pisa-mimarisi-w9b009ce
