Ayrık Difüzyon ile LLM'lerde Kayıpsız Hızlanma: Uno Mimarisi
İçindekiler
Otoregresif Modellerin Sıralı Üretim Kısıtı
Büyük Dil Modelleri (LLM), başarılarının önemli bir kısmını bir sonraki belirteci tahmin etme (Next-Token Prediction - NTP) temeline borçludur. Ancak klasik otoregresif (AR) mimari, belirteçlerin tek tek ve sıralı biçimde üretilmesini gerektirir. Bu sıralı yapı, üretim ortamlarında ve gerçek zamanlı sistemlerde ciddi bir gecikme ve hız darboğazı yaratır.
Çözüm: Difüzyon Destekli LLM'ler ve Parametre Ayrıştırma
Bu darboğazı aşmak amacıyla araştırmacılar, difüzyon destekli LLM'ler sınıfını tanıtmaktadır. Bu yeni mimari, otoregresif model dağılımını korurken, difüzyon süreci sayesinde bu dağılımdan birden fazla belirteci eşzamanlı ve paralel olarak çekmektedir. Model parametreleri iki bağımsız grupta yapılandırılır:
- Otoregresif (AR) Ağırlıkları: Standart NTP hedefiyle eğitilir ve modelin dil anlama kalitesini korur.
- Hafif Difüzyon Ağırlıkları: Çoklu belirteçleri aynı anda üretmek üzere eğitilir.
Difüzyon ağırlıkları, standart LLM eğitim süreçlerine neredeyse hiç ek maliyet getirmeyen pratik bir Difüzyon Damıtma (Diffusion Distillation) aşamasıyla öğrenilir.
Ψ-Spec ve Uno: Spekülatif Kod Çözümünden Farkı
Çalışmada, sabit bağlam uzunluğunda kayıpsız hızlanma ve çıkarım anı ölçeklemesi sağlayan Ψ-Spec örnekleyici ailesi sunulmaktadır. Uno adı verilen bu modellerin öne çıkan farkları şunlardır:
- Ayrı Taslak Model Gerektirmez: Spekülatif kod çözme tekniklerinin aksine bağımsız bir taslak (draft) modele ihtiyaç duymaz.
- Kayıpsız Kalite Sunar: Saf difüzyon modellerinin (d-LLM) aksine, hızlanmayı temel AR modelinin kalitesinden ödün vermeden gerçekleştirir.
- Esnek Mimari: Sıfırdan eğitilebildiği gibi mevcut açık ağırlıklı AR modellerine entegre edilerek de inşa edilebilir.
Yüksek Başarım ve Kıyaslama Sonuçları
Uno, test edilen tüm batch boyutlarında önde gelen spekülatif kod çözme yöntemlerinden daha yüksek veri işleme kapasitesi (throughput) sunmaktadır:
- Temel AR modeline göre donanımın desteklediği en büyük batch boyutunda dahi 3 kata varan hızlanma sağlar.
- 8B Uno modeli; ajan tabanlı araç kullanımı (agentic tool use), kodlama ve uzun bağlamlı mantık yürütme testlerinde hem açık kaynaklı 26B DiffusionGemma'yı hem de ticari Mercury 2'yi geride bırakır.
Geliştiriciler ve Mühendisler İçin Pratik Çıkarımlar
- Düşük Altyapı Karmaşıklığı: İki ayrı model yerine tek modelle spekülatif hız elde edilmesi, sunucu kaynaklarını ve GPU bellek yönetimini sadeleştirir.
- Açık Ağırlıklı Modellere Kolay Uyarlama: Geliştiriciler kendi açık modellerini difüzyon damıtma ile güçlendirerek gecikme sürelerini düşürebilir.
- Ajan ve Kod Üretiminde Yüksek Verim: Çok adımlı araç çağırma ve kodlama işlerinde kalite kaybı olmadan yüksek yanıt hızı elde edilir.
- Açık Kaynak Kodlar: Model ağırlıkları ve kod tabanı topluluk erişimine sunulmuştur.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.04010)
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →