LLM·3 dk okuma·

SAS: Bağlam Sıralamasının Uçtan Uca Optimizasyonu ile Basit Dikkat Seyreltme

Paylaş
LLMEdumints Blog

Giriş ve Mevcut Dikkat Seyreltme Yöntemlerinin Sınırları

Büyük dil modellerinde (LLM) girdi dizisi uzadıkça, Transformer mimarisinin standart dikkat mekanizması kuadratik ($O(N^2)$) bir hesaplama ve bellek maliyeti oluşturur. Eğitim sonrası dikkat seyreltme (post-training attention sparsification), her sorgu için bağlamın yalnızca küçük bir alt kümesini (token veya blok bazında) seçerek bu kümülatif maliyeti önemli ölçüde azaltmayı hedefler.

Geleneksel eğitilebilir yöntemler, bağlam birimlerini puanlamak için hafif bir seçici (selector) kullanır ve ardından sert Top-K seçimi uygular. Ancak bu ayrık seçim adımı, dil modelleme kaybından (language modeling loss) gelen gradyan akışını tamamen engeller. Bu kopukluğu aşmak için mevcut yöntemler çoğunlukla katman bazlı yoğun dikkat dağılımlarını distile eder. Bu yaklaşım, seçiciyi orijinal modeldeki yoğun dikkat ağırlıklarına göre sıralama yapmaya teşvik etse de, söz konusu sıralama sabit bir dikkat bütçesi altında nihai tahmin başarısıyla doğrudan örtüşmez. Sonuç olarak kısıtlı bütçe, tahmin çıktısına katkısı daha az olan bağlam birimlerine harcanarak israf edilir.

SAS: Uçtan Uca Bağlam Sıralaması

Bu uyumsuzluğu gidermek amacıyla geliştirilen Simple Attention Sparsification (SAS), bağlam sıralamasını dil modelleme kaybı üzerinden uçtan uca optimize eden kapılı (gated) bir seyrek dikkat mekanizmasıdır. Temel fikir, seçicinin ürettiği sürekli skorları eğitim sırasında doğrudan dikkat logitlerine enjekte ederek, kaybın standart geri yayılım (backpropagation) yoluyla seçiciyi doğrudan güncellemesini sağlamaktır.

Bu yalın tasarımın pratikte başarılı olması için belirlenen üç kritik tercih şunlardır:

  • Logaritmik Kapı Konumu: Kapının, gradyan akışını ve sayısal kararlılığı korumak için dikkat softmax'inin içerisine logaritmik formda yerleştirilmesi.
  • Normalize Softmax Kapıları: Her zaman korunan mevcut blok ile geçmiş bağlam birimleri arasında doğru bir kalibrasyon oluşturulması.
  • Sürekli Skorların Korunması: Seçici skorlarının sürekliliğinin korunarak, modelin salt ikili seçimler yerine göreceli öncelikleri öğrenmesi.

Mimari Entegrasyon ve Sonuçlar

Uzun dizilerde eğitimi ve çıkarımı desteklemek adına SAS, FlashAttention tarzı hesaplamalara entegre edilen bellek verimli özel bir Triton çekirdeği (kernel) ile uygulanmıştır. Mantıksal akıl yürütme, uzun bağlam anlama ve otonom ajan görevlerinde SAS, farklı dikkat bütçelerinde eğitilebilir seyrek dikkat alternatiflerini tutarlı şekilde geride bırakmıştır. Özellikle sıkı dikkat bütçelerinde elde edilen yüksek kazanımlar, bağlam sıralamasının downstream görevler için çok daha etkili yapıldığını göstermektedir.

Yazılım Geliştirme Açısından Pratik Çıkarımlar

  • KV-Cache ve Maliyet Yönetimi: Üretim seviyesinde bağlam budama yaparken, seçiciyi yalnızca orijinal dikkat ağırlıklarına göre değil, doğrudan kayıp fonksiyonuna göre optimize edin.
  • Triton ile Donanım Hızlandırma: Seyrek dikkat algoritmalarının gerçek hız kazanımı sağlaması için FlashAttention uyumlu Triton çekirdekleri geliştirerek SRAM bant genişliğinden azami yararlanın.
  • Gradyan Akışını Korumak: Sert Top-K seçimleri yerine sürekli kapılama mekanizmalarını tercih ederek modelin öncelik hiyerarşisini kaybetmesini önleyin.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.13141)


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →