Yapay Zeka·3 dk okuma·

ComfyUI'da MiniMax H3 Sıfırıncı Gün Desteği: Açık Ağırlıklar, Yerel Ses ve 2K Video

Paylaş
Yapay ZekaEdumints Blog

MiniMax H3, açık ağırlıklı mimarisiyle yayınlandı ve ilk günden itibaren ComfyUI üzerinde yerel destek kazandı. Hailuo 01 ve Hailuo 02'nin ardından gelen bu üçüncü nesil omni-modal model, geliştiricilere metin, görsel, video veya ses girdilerinden 15 saniyeye kadar 2K çözünürlükte video üretme imkânı sunuyor. Üstelik ses üretimi sonradan eklenmek yerine videoyla eş zamanlı ve yerel stereo olarak gerçekleşiyor.

Modelin Öne Çıkan Özellikleri

  • Metinden Videoya (Text-to-video): Yalnızca doğal dil istemleri (prompt) kullanılarak dinamik sahneler oluşturulur.
  • Görselden Videoya (Image-to-video): Statik görseller canlandırılarak hareketli karelere dönüştürülür.
  • İlk ve Son Kare Kontrolü (First-and-last-frame): Başlangıç ve bitiş kareleri belirlenip aradaki geçiş tamamen modele bırakılır.
  • Referanstan Videoya (Reference-to-video): Referans medya verilerek belirli bir nesne, hareket veya ses klip boyunca korunur.

Çok Modlu Bağlam Anlama

Beş ayrı iş yükünü tek bir modelde birleştiren H3, çok modlu bağlamları başarıyla işler. Yazılım geliştiriciler için bu durum, farklı yapay zeka hatlarını (pipeline) tek mimaride toplama ve sistem karmaşıklığını azaltma pratikliği sağlar.

Yerel Stereo Ses

Ses, ikincil bir işlem aşaması değil; modelin doğrudan ürettiği bir bileşendir. Bu entegrasyon, medya işleme sistemlerinde senkronizasyon maliyetlerini ve mimari bağımlılıkları düşürür.

Düzenleme ve Hareket Aktarımı

Graph tabanlı çalışmalarda hareket aktarımı kritik bir role sahiptir. Referans videodan kamera hareketi ve performans alınırken, stil ve konu bağımsız olarak güncellenebilir. Bu esneklik yinelemeli geliştirmeyi hızlandırır.

Örnek Çıktılar

Farklı modların bir arada kullanıldığı testlerde; çizgi roman tarzı sanatsal üretimlerden ürün tanıtım videolarına kadar yüksek detaylı ve uyumlu çıktılar elde edilmektedir. Bu çoklu girdi desteği, geliştiricilerin özelleştirilmiş AI video uygulamaları tasarlamasını kolaylaştırır.

ComfyUI'da Yerel Çıkarım İçin Optimize Edildi

Modelin tüketici sınıfı donanımlarda çalışabilmesi için ciddi bir makine öğrenimi mühendisliği uygulanmıştır. Modülasyon ağırlıklarının (~%40) budanıp arama tablolarıyla (lookup table) değiştirilmesi, Int8 convrot kuantizasyonu ve özel çekirdekler (kernel) sayesinde bellek kullanımı %66 azaltılmıştır (123.6 GB'tan 42.5 GB'a). Dinamik VRAM aktarımı ile birlikte RTX 3060 gibi GPU'larda dahi yerel çıkarım (local inference) yapmak mümkün hale gelmiştir. Bu durum, bütçe dostu donanımlarda yüksek performanslı AI uygulamaları geliştirmek isteyen yazılımcılar için büyük bir pratik avantaj sağlar.

Başlarken

  1. ComfyUI uygulamasını 0.30.0 sürümüne güncelleyin veya Comfy Cloud servisini tercih edin.
  2. Hazır iş akışlarını (I2V, R2V, T2V workflow) şablon kütüphanesinden indirin.
  3. İş akışındaki talimatları takip ederek model ağırlıklarını HuggingFace üzerinden ilgili dizine kaydedin.
  4. İstemlerinizi yazın, referans girdilerinizi bağlayın ve süreci başlatın.

Yazılım geliştiriciler için açık ağırlıklı multimodal modeller, kendi yerel yapay zeka sistemlerini kurma ve optimize etme konusunda harika bir öğrenme fırsatı sunmaktadır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://blog.comfy.org/p/minimax-h3-day-0-support-in-comfyui)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →