LLM·2 dk okuma·

Bellek Duvarının Diğer Yarısı: Eğitilmiş Yönlendirme Tahmini ile SSD Üzerinden 35B MoE Modellerini Sunmak

Paylaş
LLMEdumints Blog

1. Giriş: Tüketici Donanımlarında Bellek Duvarı ve MoE Kısıtı

Tüketici sınıfı donanımlarda Mixture-of-Experts (MoE) modelleriyle çıkarım (inference) yapmak, doğrudan model ağırlık belleği (weight memory) engeline takılmaktadır. 4-bit seviyesinde kuantize edilmiş 35 milyar parametreli (35B) bir model dahi yaklaşık 19.5 GB bellek alanı talep eder. MoE mimarisinin sunduğu seyreklik (sparsity), token başına düşen hesaplama yükünü azaltsa da sistem belleğinde tutulması gereken toplam bayt miktarını küçültmemektedir.

2. Geleneksel SSD Aktarımının (Offloading) Yetersizliği

Model ağırlıklarını doğrudan SSD'ye aktarmak (naive offloading) bu darboğazı tek başına çözememektedir. Çünkü katman $N+1$ içerisindeki uzmanların (experts) belirlenebilmesi için öncelikle katman $N$'in çıktısının üretilmiş olması şarttır. Bu sıralı bağımlılık sebebiyle SSD okuma operasyonları zamanında başlatılamaz ve okuma gecikmesi hesaplama sürecinin arkasına gizlenemez (compute/IO overlap sağlanamaz).

3. Edge0 Mimarisi ve Ön Yönlendirici (Prerouter) Çözümü

Edge0, bu gecikme açığını kapatmak üzere tasarlanmış akış tabanlı bir MoE çıkarım motorudur:

  • Ön Yönlendirici (Prerouter): Her katmanda yer alan özel bir başlık, bir sonraki katmanın uzman yönlendirmesini bir token önceden tahmin eder.
  • Kayıpsız Eşleşme: Üretilen bu tahmin doğrudan yönlendirme kararının kendisi olarak kullanılır. Böylece SSD'den sahneye alınan (staged) uzman seti ile yönlendirilen uzman seti birebir eşitlenir ve hiçbir token veya uzman atılmaz (drop edilmez).

4. Kurtarma LoRA'sı ile Doğruluk Telafisi

Yönlendirme mekanizmasının tahminle değiştirilmesi ve int4 kuantizasyon işlemleri belirli bir kalite kaybı oluşturur. Edge0, öğrenci yolu (student path) üzerinde eğitilen ve ana ağırlıklarla birleştirilmemiş (unmerged) bir kurtarma LoRA'sı (recovery LoRA) ile bu kalite kaybını tamamen telafi eder.

5. Performans Sonuçları ve Pratik Yazılım Çıkarımları

Sistem, geliştiriciler ve yapay zeka mühendisleri için üretim ortamında dikkate değer sonuçlar sunmaktadır:

  • Düşük Kaynak Tüketimi: Yalnızca 24GB belleğe sahip tek bir makinede, 35B MoE modeli 3 GiB pik aktif bellek sınırları içinde saniyede 20 token (20 tok/s) hızla servis edilir.
  • Yüksek Kalite Korunumu: Beş genel benchmark testinde, modelin fp16 öğretmen sürümüne kıyasla yalnızca birkaç puanlık farkla yüksek doğruluk korunur.
  • Açık Kaynak Ekosistemi: Aynı çalışma çerçevesi 8B seviyesindeki modelleri de desteklemekte olup altyapı motoru, kontrol noktaları (checkpoints) ve adaptörler açık kaynaklıdır.

Yazılım Geliştiriciler İçin Pratik Çıkarım: MoE modellerini yerel sunucularda çalıştırmak için pahalı ve çoklu GPU kümeleri zorunlu değildir. SSD I/O döngülerini tahmine dayalı yönlendirme boru hatlarıyla (pipelining) birleştirmek ve LoRA katmanlarıyla kuantizasyon kayıplarını gidermek, tüketici donanımlarında düşük maliyetli yüksek verimli LLM servisleri geliştirmeyi mümkün kılar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.18063)


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →