LLM·3 dk okuma·

Bir Fizikçi Gibi LLM Budama: Bir Ising Optimizasyon Problemi Olarak Blok Çıkarma

Paylaş
LLMEdumints Blog

Büyük dil modellerini (LLM) daha hızlı ve verimli kılmanın en doğrudan ve pratik yollarından biri, belirli transformatör bloklarını tamamen modelden çıkarmaktır. Derinlik budama (depth pruning) olarak adlandırılan bu blok çıkarma yöntemi, modeli doğrudan kısalttığı için bellek tasarrufunun yanı sıra öngörülebilir çıkarım (inference) hızlanması sunar; üstelik kuantizasyon ve düşük dereceli matris yaklaşımları (low-rank compression) gibi diğer tekniklerle pürüzsüz biçimde bir arada çalışır.

Ancak buradaki asıl zorluk, hangi blokların silineceğine karar vermektir. Yanlış blokların kesilmesi modelin çökmesine neden olur. Dahası, tek bir bloğun çıkarılmasının etkisi, onunla birlikte hangi blokların çıkarıldığına bağlıdır. Dolayısıyla blok seçimi bağımsız bir sıralama (ranking) meselesi değil, ikili değişkenlerin birbirleriyle sürekli etkileştiği kombinatoryal bir problemdir. Bu durum, tam olarak istatistiksel spin sistemleri fiziğinin açıklamak üzere tasarlandığı alana denk düşer.

LLM Compression by Block Removal with Constrained Binary Optimization adlı çalışma, bu fiziksel analojiyi doğrudan algoritmaya dönüştürür. Blok seçimi, her bir spinin diğerleriyle etkileştiği ve belirli sayıda "yukarı" spin içeren bir Ising camı (spin glass) sistemine, yani kısıtlı bir ikili optimizasyon (CBO) problemine eşlenir. Bu spin sisteminin enerjisi, budanan modelin kıyaslama (benchmark) skorlarını tahmin eden son derece ucuz ve güçlü bir vekil metrik (proxy) işlevi görür. Böylece modelleri tek tek değerlendirme yüküne girmeden devasa konfigürasyonlar taranabilir. Örneğin, Llama-3.3-70B-Instruct modelinde uygulanan %50 sıkıştırmada, en iyi alternatif blok çıkarma yöntemine kıyasla MMLU skorunda 23 puanlık çarpıcı bir üstünlük sağlanmıştır.

Blok Seçimi Neden Bir "Çok Parçacık" (Many-Body) Problemine Dönüşür?

Mevcut blok çıkarma yöntemlerinin çoğu, her bloğu büyüklük veya etki derecesine göre bağımsız puanlar. Fizik dilinde bunlar ortalama alan (mean-field) yöntemleridir; bir bloğun komşularıyla olan dinamik bağını yok sayarak bağımsız davranırlar. Yaygın diğer bir kestirme yol ise sadece birbirini izleyen ardışık blok dizilerini silmektir; bu arama uzayını daraltsa da optimum çözümleri dışarıda bırakır.

Gerçekte bloklar tıpkı bir mıknatıstaki spinler gibi birbirine bağımlıdır:

  • Kuplaj (Coupling) Etkisi: 20. bloğun silinmesinin modele etkisi, 19. veya 24. bloğun da silinip silinmediğine bağlıdır.
  • Üstel Karmaşıklık: Katmanlar arası etkileşimler arttıkça kaba kuvvet (brute-force) taraması imkansızlaşır; bu noktada istatistiksel fizik araçları devreye girer.

Fikir: Blok Seçimini Bir Enerji Minimizasyonu Problemine Dönüştürmek

Blok silme/tutma kararları ikili durumlar (-1 veya +1) olarak modellenir ve ikili etkileşimler bir enerji fonksiyonuna dönüştürülür. Böylece doğru mimariyi seçmek, klasik ve kuantum esintili çözücülerle küresel minimum enerjiyi bulma problemine indirgenir.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Çıkarım Optimizasyonu: Derinlik budama, kuantizasyon öncesinde çıkarım gecikmesini (latency) doğrudan düşüren ilk aşama optimizasyonu olarak kurgulanmalıdır.
  • Etkileşimli Modelleme: Katmanları bağımsız sıralamak yerine kuplajları dikkate alan optimizasyon algoritmaları benimsenmelidir.
  • Ucuz Değerlendirme (Proxy Evals): Yüksek maliyetli benchmark testleri yerine fizik tabanlı vekil enerji fonksiyonları kullanılarak tarama maliyetleri azaltılabilir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →