Paralel Taslak-Token Üretiminde Difüzyon Modeli Yaklaşımı: Gemma Üzerinde DFlash Deneyimi

İçindekiler
Büyük dil modellerinde (LLM) üretim hızını artırmak için kullanılan MTP (Multi-Token Prediction / Çoklu Token Tahmini) yaklaşımı; hafif bir "taslak model"in sıradaki token'ları önceden tahmin etmesi, ana modelin ise bu tahminleri tek bir adımda topluca doğrulaması esasına dayanır. Tahminler doğru çıktığında, tek adımda birden fazla token geçilerek çıkarım süresi belirgin biçimde hızlanır.
Taslak modeller genellikle otoregresif mimarilerle kurulurken, DFlash alışılmadık bir yaklaşım sergileyerek görüntü üretiminden tanıdığımız difüzyon modellerini devreye alıyor. Token'ları sırayla üretmek yerine bloklar halinde tek seferde ve paralel tahmin eden DFlash, geniş bir model yelpazesini desteklediğini ve mevcut EAGLE-3 yönteminden daha yüksek performans sunduğunu iddia ediyor.
Üretici laboratuvarların sunduğu benchmark'ların gerçek geliştirici ortamlarındaki karşılığını görmek amacıyla bağımsız bir test gerçekleştirildi: 12GB VRAM'li bir RTX 3060, llama.cpp ve JavaScript kodlama görevi kullanılarak DFlash, Gemma-4-12B-it modelinin kendi optimize taslak modeli olan yerel Assistant modeli ile doğrudan kıyaslandı. Sonuç olarak DFlash, yerel Assistant modelinin performansını geçemedi. Ancak bu sonucun teknik nedenleri, sistemin güçlü ve zayıf yönlerini anlamak adına oldukça nettir.
Genel Bakış
Son dönemde birbirinin ardı sıra iki yeni token tahmin tekniği tanıtıldı:
- DeepSeek (DSpark): Yalnızca DeepSeek-V4 ve DeepSeek-V4-Flash modellerinin çıkarımını hızlandırmak üzere geliştirilmiş özel bir teknik.
- UC San Diego Z-Lab (DFlash): Her hedef modele özel ayrı bir taslak model sunarak çok daha geniş bir ekosisteme harici eklenti olarak takılabilen bir yapı.
DFlash tarafından desteklenen modeller:
- Gemma-4 serisi (12B, 26B-A4B, 31B)
- MiniMax-M2.7
- MiniMax-M2.5
- Qwen 3.6 serisi (35B-A3B, 27B)
- Qwen3.5 serisi (4B, 9B, 35B-A3B, 27B, 122B-A10B, 397B-A17B)
- Qwen3 serisi (4B, 8B, Coder-30B-A3B)
- Kimi-K2.6
- GLM-5.1-FP8
- gpt-oss (20B, 120B)
- LLaMa3.1-8B-Instruct
Z-Lab; aynı zamanda NVIDIA bünyesinde araştırmacı olan UC San Diego Öğretim Üyesi Zhijian Liu liderliğinde, yapay zekayı daha küçük, hızlı ve verimli kılmak için algoritma, sistem ve uygulama katmanlarında çalışan bir araştırma grubudur.
DFlash Token'ları Nasıl Tahmin Ediyor?
"DFlash: Block Diffusion for Flash Speculative Decoding" makalesiyle sunulan bu yaklaşım, spekülatif kod çözme temeline dayanır. Google DeepMind'ın 2023'te yayımladığı "Accelerating Large Language Model Decoding with Speculative Sampling" makalesiyle başlayan süreç, 2025'te EAGLE-3 gibi taslak modellerle sürdü. Ancak EAGLE-3 otoregresif döngüden kopamadığı için beklenen sıçramayı yapamadı. DFlash ise difüzyonun gürültü giderme mekanizmasını metin bloklarına uygulayarak paralel tahmin üretmeyi dener.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar: Yerel GPU'larda model dağıtımı (local inference) yaparken kuramsal benchmark'lara temkinli yaklaşılmalıdır. Donanım kısıtları altında, mimariye özel eğitilmiş kompakt taslak modeller, harici difüzyon tabanlı paralel taslaklara kıyasla bellek ve gecikme açısından daha tutarlı ve yüksek verim sunabilmektedir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →