---
title: "Bellek Duvarının Diğer Yarısı: Eğitilmiş Yönlendirme Tahmini ile SSD Üzerinden 35B MoE Modellerini Sunmak"
url: https://blog.edumints.com/bellek-duvarinin-diger-yarisi-egitilmis-yonlendirme-tahmini-8stf76ao
category: "LLM"
date: 2026-09-17T15:07:21.362Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.18063
---

# Bellek Duvarının Diğer Yarısı: Eğitilmiş Yönlendirme Tahmini ile SSD Üzerinden 35B MoE Modellerini Sunmak

## 1. Giriş: Tüketici Donanımlarında Bellek Duvarı ve MoE Kısıtı
Tüketici sınıfı donanımlarda **Mixture-of-Experts (MoE)** modelleriyle çıkarım (inference) yapmak, doğrudan model ağırlık belleği (weight memory) engeline takılmaktadır. 4-bit seviyesinde kuantize edilmiş 35 milyar parametreli (35B) bir model dahi yaklaşık **19.5 GB** bellek alanı talep eder. MoE mimarisinin sunduğu seyreklik (sparsity), token başına düşen hesaplama yükünü azaltsa da sistem belleğinde tutulması gereken toplam bayt miktarını küçültmemektedir.

## 2. Geleneksel SSD Aktarımının (Offloading) Yetersizliği
Model ağırlıklarını doğrudan SSD'ye aktarmak (naive offloading) bu darboğazı tek başına çözememektedir. Çünkü katman $N+1$ içerisindeki uzmanların (experts) belirlenebilmesi için öncelikle katman $N$'in çıktısının üretilmiş olması şarttır. Bu sıralı bağımlılık sebebiyle SSD okuma operasyonları zamanında başlatılamaz ve okuma gecikmesi hesaplama sürecinin arkasına gizlenemez (compute/IO overlap sağlanamaz).

## 3. Edge0 Mimarisi ve Ön Yönlendirici (Prerouter) Çözümü
**Edge0**, bu gecikme açığını kapatmak üzere tasarlanmış akış tabanlı bir MoE çıkarım motorudur:
- **Ön Yönlendirici (Prerouter):** Her katmanda yer alan özel bir başlık, bir sonraki katmanın uzman yönlendirmesini bir token önceden tahmin eder.
- **Kayıpsız Eşleşme:** Üretilen bu tahmin doğrudan yönlendirme kararının kendisi olarak kullanılır. Böylece SSD'den sahneye alınan (staged) uzman seti ile yönlendirilen uzman seti birebir eşitlenir ve hiçbir token veya uzman atılmaz (drop edilmez).

## 4. Kurtarma LoRA'sı ile Doğruluk Telafisi
Yönlendirme mekanizmasının tahminle değiştirilmesi ve int4 kuantizasyon işlemleri belirli bir kalite kaybı oluşturur. Edge0, öğrenci yolu (student path) üzerinde eğitilen ve ana ağırlıklarla birleştirilmemiş (unmerged) bir **kurtarma LoRA'sı** (recovery LoRA) ile bu kalite kaybını tamamen telafi eder.

## 5. Performans Sonuçları ve Pratik Yazılım Çıkarımları
Sistem, geliştiriciler ve yapay zeka mühendisleri için üretim ortamında dikkate değer sonuçlar sunmaktadır:
- **Düşük Kaynak Tüketimi:** Yalnızca 24GB belleğe sahip tek bir makinede, 35B MoE modeli **3 GiB pik aktif bellek** sınırları içinde saniyede **20 token** (20 tok/s) hızla servis edilir.
- **Yüksek Kalite Korunumu:** Beş genel benchmark testinde, modelin fp16 öğretmen sürümüne kıyasla yalnızca birkaç puanlık farkla yüksek doğruluk korunur.
- **Açık Kaynak Ekosistemi:** Aynı çalışma çerçevesi 8B seviyesindeki modelleri de desteklemekte olup altyapı motoru, kontrol noktaları (checkpoints) ve adaptörler açık kaynaklıdır.

**Yazılım Geliştiriciler İçin Pratik Çıkarım:**
MoE modellerini yerel sunucularda çalıştırmak için pahalı ve çoklu GPU kümeleri zorunlu değildir. SSD I/O döngülerini tahmine dayalı yönlendirme boru hatlarıyla (pipelining) birleştirmek ve LoRA katmanlarıyla kuantizasyon kayıplarını gidermek, tüketici donanımlarında düşük maliyetli yüksek verimli LLM servisleri geliştirmeyi mümkün kılar.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.18063)](https://huggingface.co/papers/2609.18063)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.18063)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/bellek-duvarinin-diger-yarisi-egitilmis-yonlendirme-tahmini-8stf76ao
