Viggle/Qwen-Image-2.1-viggle-turbo — Hugging Face'te Öne Çıkan Hızlı Görsel Üretim Modeli
İçindekiler
Model Bilgileri:
- Model: Viggle/Qwen-Image-2.1-viggle-turbo
- İndirme: 175.907 | Beğeni: 394
- Etiketler: diffusers, safetensors, lora, text-to-image, image-to-image, image-editing, distillation, dmd
Model Özeti ve Mimari
Qwen-Image-2.1-viggle-turbo (v0.2.1), Qwen/Qwen-Image-2.1 temel modelinin Viggle tarafından Dağılım Eşleme Damıtması (Distribution Matching Distillation - DMD) tekniğiyle eğitilmiş hızlı bir öğrenci (student) modelidir. Model, sınıflandırıcıdan bağımsız yönlendirme (CFG) gerektirmeden, 40 transformer adımı yerine yalnızca 6 adımda metinden görsele üretim ve 1–3 referans görselle talimat odaklı görsel düzenleme gerçekleştirebilmektedir. Uçtan uca yaklaşık 5 kat daha hızlı çalışan model, resmi Qwen örneklerinin çoğunda temel modelle ayırt edilmesi zor bir görsel kalite sunar. En belirgin kalite farkı yoğun ve küçük metinlerde görülmekte olup (8 adımlık örnekleme bu farkı daraltır), karmaşık düzenlemeler de temel modelin gerisinde kalabilmektedir.
v0.2.1 (2026-09-24) — Öne Çıkan Dosyalar ve Kullanım
- Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r256.safetensors: Çalışma zamanında temel transformer üzerine yüklenen LoRA adaptörüdür (rank 256, alpha 256, bf16, 1.3 GB).
sigmas=[1.0, 0.9375, 0.875, 0.75, 0.5, 0.25]düğümleriyle 6 adımda örneklenir ve resmi demo alanında bu dosya çalışır. - Qwen-Image-2.1-viggle-turbo-v0.2.1-6step-lora-r128.safetensors: ComfyUI iş akışlarında kullanılan rank 128 sürümüdür (alpha 128, 680 MB). r256 adaptörüyle aynı şekilde kullanılır ve çıktı kalitesi oldukça yakındır.
- ComfyUI Düğümleri:
comfyui/dizininde hazır metinden görsele ve görsel düzenleme iş akışları mevcuttur. Diffusers kütüphanesiyle doğrulanmış olup açık kaynak topluluğunun geri bildirimlerine ve geliştirmelerine açıktır.
Sürüm Karşılaştırmaları ve v0.1'e Göre Değişiklikler
v0.2.1 sürümü, 600. adımda yayımlanan v0.2 sürümünün 100 ek eğitim adımı görmüş 700. adım kontrol noktasıdır. Aynı 6 adımlı çizelgeyle v0.2'ye göre biraz daha keskindir (Laplacian keskinliği 0.0187 yerine 0.0199) ve temel modele göre çeşitlilik marjinal olarak artmıştır (0.97× yerine 0.98×).
96 kullanıcı isteğiyle test edilen v0.1'e kıyasla gerçekleşen temel değişimler:
- Örnek Çeşitliliği: v0.1'deki seed'lerin aynı yerleşimlere çökme sorunu çözülmüş, temel modele kıyasla çeşitlilik oranı 0.75'ten 0.98'e yükseltilmiştir.
- Kompozisyon Kayması: Yatay merkez kayması v0.1'deki −0.019 değerinden +0.000 seviyesine getirilerek temel model yerleşimi tam korunmuştur.
- Yerleşim Farklılığı: Temel modelden farklı yerleşim sergileyen girdi oranı %0 olarak ölçülmüştür.
Yazılım Geliştirme ve MLOps Çıkarımları
Geliştiriciler açısından bu model; üretim ortamlarında inference maliyetlerini ve gecikme (latency) sürelerini düşürmek için model damıtma (distillation) ile LoRA mimarisinin birlikte nasıl optimize edilebileceğinin somut bir örneğidir. 40 adımdan 6 adıma inerek 5 kat hız kazanılması, gerçek zamanlı görsel servisleri sunan mühendisler için kritik bir kaynak tasarrufu sağlar. Düşük bellek tüketimli rank-128 seçeneği ise kısıtlı GPU bütçesine sahip sistemlerde yüksek verimli servis dağıtımı yapmayı mümkün kılar.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →