Gradio Workflow ile AUTOMATIC1111'i Yeniden İnşa Etmek
İçindekiler
Yapay zekâ tabanlı görsel üretim ekosisteminde AUTOMATIC1111 (stable-diffusion-webui), geniş araç setiyle uzun süredir referans bir arayüz konumundadır. Workflow1111, bu karmaşık yapıyı tek bir görsel iş akışı tuvali (workflow canvas) üzerinde yeniden kurguluyor. 73 düğümden (node) oluşan ve 11 farklı medya boru hattını (media pipeline) bir araya getiren bu sistem; metinden görüntüye, yüksek çözünürlük onarımına, görsel sorgulamadan (VLM interrogate) arka plan temizlemeye kadar modern SOTA modellerini entegre biçimde sunar. Kullanıcılar Hugging Face hesaplarıyla oturum açarak kendi kotaları üzerinden bu hatları çalıştırabilir veya alanı (Space) çoğaltıp kendi ihtiyaçlarına göre yeniden yapılandırabilir.
Tuvalde Neler Var?
Tüm medya boru hatları, mimariyi modüler kılan dört temel operatör türü üzerine inşa edilmiştir. Geliştiriciler için bu yaklaşım, karmaşık modelleri standart girdi ve çıktı portlarıyla birbirine bağlamayı sağlar:
- fn: Özel Python fonksiyonlarını çalıştıran mantık düğümü.
- model:
InferenceClientüzerinden çağrılan model düğümü. - space: Harici bir Gradio Space uygulamasını bağlayan düğüm.
- dataset: Hub veri kümesinden belirli bir satırı çeken düğüm.
Boru Hatları ve Mühendislik Çıkarımları
İş akışında yer alan beş temel boru hattı ve yazılım geliştirme açısından öne çıkan pratik çıkarımları şunlardır:
- Metinden Görüntüye (Text-to-image): Çekirdek boru hattıdır; negatif prompt, adımlar, CFG ve tohum gibi temel parametreleri yönetir. Prompt önce stil şablonunu ekleyip metni temizleyen bir
fndüğümünden geçer, ardından çıkarım sağlayıcıları üzerindenmodeldüğümüne iletilir. Çıkıştaki birfndüğümü ise üretim parametrelerini PNG meta verisine yazarak veri kalıcılığını ve durum takibini garanti eder. - Yüksek Çözünürlük Düzeltmesi (Hi-resolution fix): Klasik sistemlerdeki karmaşık ölçeklendirme ve ikinci gürültü giderme döngüsü yerine, iki düğümlük pratik bir ara hat kurgulanmıştır. Üretilen görsel doğrudan FLUX.1-Kontext
modeldüğümüne iyileştirme talimatıyla gönderilerek kompozisyon korunur, mikrodokular zenginleştirilir ve çıktı büyütülür. - Görüntüden Görüntüye (Image-to-image): Aynı Kontext düğümü çok amaçlı kullanılarak arayüzde kod ve bileşen tekrarı engellenir. Kullanıcı bir görsel yükleyip hedef değişikliği tarif ettiğinde düzenlenmiş sonuç doğrudan üretilir.
- Prompt'u Bir LLM'e Yazdırma (Let an LLM write the prompt): Kaba taslak istemler Qwen3-4B
modeldüğümüne gönderilir; ardından küçük birfndüğümü yanıtı en fazla 40 etiketlik düzenli bir listeye dönüştürür. ComfyUI'ın aksine özel düğüm (custom node) yazmaya gerek kalmadan, LLM ve difüzyon modelleri aynı tuvalde standart operatörler olarak zincirlenir. - Görüntüyü Tekrar Prompt'a Dönüştürme (Read an image back into a prompt): A1111'deki CLIP sorgulamasının yerini alan çok modlu Qwen2.5-VL modeli, bir görseli inceleyerek onu üretebilecek detaylı istemi oluşturur; ViT sınıflandırmasıyla desteklenen bu mekanizma modeller arası anlamsal köprü kurarak tersine mühendislik imkânı tanır.
Bu mimari, monolitik yazılımlar yerine mikro-operatör tabanlı, yeniden yapılandırılabilir ve bakımı kolay iş akışları tasarlamanın pratik gücünü sergilemektedir.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →