---
title: "Ayrık Difüzyon ile LLM'lerde Kayıpsız Hızlanma: Uno Mimarisi"
url: https://blog.edumints.com/ayrik-difuzyon-ile-llmlerde-kayipsiz-hizlanma-uno-mimarisi-1odj680d
category: "AI Araçları"
date: 2026-09-08T09:08:30.070Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.04010
---

# Ayrık Difüzyon ile LLM'lerde Kayıpsız Hızlanma: Uno Mimarisi

## Otoregresif Modellerin Sıralı Üretim Kısıtı
Büyük Dil Modelleri (**LLM**), başarılarının önemli bir kısmını bir sonraki belirteci tahmin etme (**Next-Token Prediction - NTP**) temeline borçludur. Ancak klasik otoregresif (**AR**) mimari, belirteçlerin tek tek ve sıralı biçimde üretilmesini gerektirir. Bu sıralı yapı, üretim ortamlarında ve gerçek zamanlı sistemlerde ciddi bir gecikme ve hız darboğazı yaratır.

## Çözüm: Difüzyon Destekli LLM'ler ve Parametre Ayrıştırma
Bu darboğazı aşmak amacıyla araştırmacılar, **difüzyon destekli LLM'ler** sınıfını tanıtmaktadır. Bu yeni mimari, otoregresif model dağılımını korurken, difüzyon süreci sayesinde bu dağılımdan birden fazla belirteci eşzamanlı ve paralel olarak çekmektedir. Model parametreleri iki bağımsız grupta yapılandırılır:
- **Otoregresif (AR) Ağırlıkları:** Standart NTP hedefiyle eğitilir ve modelin dil anlama kalitesini korur.
- **Hafif Difüzyon Ağırlıkları:** Çoklu belirteçleri aynı anda üretmek üzere eğitilir.

Difüzyon ağırlıkları, standart LLM eğitim süreçlerine neredeyse hiç ek maliyet getirmeyen pratik bir **Difüzyon Damıtma (Diffusion Distillation)** aşamasıyla öğrenilir.

## Ψ-Spec ve Uno: Spekülatif Kod Çözümünden Farkı
Çalışmada, sabit bağlam uzunluğunda kayıpsız hızlanma ve çıkarım anı ölçeklemesi sağlayan **Ψ-Spec** örnekleyici ailesi sunulmaktadır. **Uno** adı verilen bu modellerin öne çıkan farkları şunlardır:
- **Ayrı Taslak Model Gerektirmez:** Spekülatif kod çözme tekniklerinin aksine bağımsız bir taslak (*draft*) modele ihtiyaç duymaz.
- **Kayıpsız Kalite Sunar:** Saf difüzyon modellerinin (d-LLM) aksine, hızlanmayı temel AR modelinin kalitesinden ödün vermeden gerçekleştirir.
- **Esnek Mimari:** Sıfırdan eğitilebildiği gibi mevcut açık ağırlıklı AR modellerine entegre edilerek de inşa edilebilir.

## Yüksek Başarım ve Kıyaslama Sonuçları
Uno, test edilen tüm batch boyutlarında önde gelen spekülatif kod çözme yöntemlerinden daha yüksek veri işleme kapasitesi (**throughput**) sunmaktadır:
- Temel AR modeline göre donanımın desteklediği en büyük batch boyutunda dahi **3 kata varan hızlanma** sağlar.
- **8B Uno** modeli; ajan tabanlı araç kullanımı (*agentic tool use*), kodlama ve uzun bağlamlı mantık yürütme testlerinde hem açık kaynaklı **26B DiffusionGemma**'yı hem de ticari **Mercury 2**'yi geride bırakır.

## Geliştiriciler ve Mühendisler İçin Pratik Çıkarımlar
- **Düşük Altyapı Karmaşıklığı:** İki ayrı model yerine tek modelle spekülatif hız elde edilmesi, sunucu kaynaklarını ve GPU bellek yönetimini sadeleştirir.
- **Açık Ağırlıklı Modellere Kolay Uyarlama:** Geliştiriciler kendi açık modellerini difüzyon damıtma ile güçlendirerek gecikme sürelerini düşürebilir.
- **Ajan ve Kod Üretiminde Yüksek Verim:** Çok adımlı araç çağırma ve kodlama işlerinde kalite kaybı olmadan yüksek yanıt hızı elde edilir.
- **Açık Kaynak Kodlar:** Model ağırlıkları ve kod tabanı topluluk erişimine sunulmuştur.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.04010)](https://huggingface.co/papers/2609.04010)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.04010)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/ayrik-difuzyon-ile-llmlerde-kayipsiz-hizlanma-uno-mimarisi-1odj680d
