MiniMax-H3: Çok Modlu Video ve Yerel Ses Üreten Yeni Nesil Üretici Model
İçindekiler
Model Özeti ve Erişim Kanalları
MiniMaxAI tarafından geliştirilen MiniMax-H3, Hugging Face platformunda 5.1 milyonu aşkın indirme ve 4.883 beğeniye ulaşmış genel amaçlı, çok modlu (omni-modal) bir üretici yapay zeka sistemidir. Model; diffusers, safetensors, metinden videoya, görselden videoya, görsel-metinden videoya, videodan videoya ve metinden sesli videoya gibi etiketlerle öne çıkmaktadır. Geliştiriciler modele API üzerinden küresel (platform.minimax.io) ve Çin (platform.minimaxi.com) servisleriyle erişebilirken; son kullanıcılar WebApp (hailuoai.video / hailuoai.com) ve masaüstü uygulaması (hub.minimax.io / hub.minimaxi.com) üzerinden deneyimleyebilmektedir. Ayrıca prompt yazım kalitesini artırmak için GitHub üzerinde resmi beceriler (skills) sunulmaktadır.
Sistem Genel Bakışı ve Çıktı Özellikleri
H3; metin, görsel, video ve sesten oluşan çok modlu bağlamları birleşik bir yapıda anlar; 2K çözünürlüğe ve 15 saniyeye kadar yerel stereo sesli videolar üretebilir. Görev genelleştirme odaklı tasarımı sayesinde ön eğitim aşamasında karmaşık talimatları kavrama yetisi kazanmıştır. Girdi ve çıktı teknik özellikleri şunlardır:
- Çıktı süresi: 4–15 saniye.
- Çıktı en-boy oranı: 21:9, 16:9, 4:3, 1:1, 3:4 ve 9:16 dahil olmak üzere geniş oran yelpazesi.
- Çıktı çözünürlüğü: Kısa kenar varsayılan olarak 768 pikseldir; H3-Regenerate-2K ile 2K üretim desteklenir.
- Kare hızı (FPS): 24 FPS.
- Çıktı sesi: 32 kHz stereo.
- Desteklenen diyalog dilleri: 11 dilde kararlı destek (Arapça, Çince, İngilizce, Fransızca, Almanca, İtalyanca, Japonca, Korece, Portekizce, Rusça ve İspanyolca) ve değişken düzeylerde ek diller.
Model Varyantları ve Girdi Modları
Sistem, kullanım senaryolarına göre iki temel model varyantı sunar:
- H3-Base-FL2VA (İlk ve Son Kare Modu): 0, 1 veya 2 görsel girdisini destekler:
- Görsel girdisi yok: Metinden videoya (Text-to-video) modu
- 1 görsel girdisi: İlk kareden videoya veya son kareden videoya üretim
- 2 görsel girdisi: İlk ve son kareden videoya üretim
- H3-Base-Ref2VA (Omni-Referans Modu): Çok modlu referans girdilerini destekler:
- Görseller: En fazla 9 görsel
- Videolar: En fazla 3 klip (her klip 2–15 sn, toplam süre ≤ 15 sn)
- Sesler: En fazla 3 klip (her klip 2–15 sn, toplam süre ≤ 15 sn)
- Karma girdiler: Tüm türlerde toplam en fazla 12 dosya
Sistem Modülleri ve Mimari
Tam H3 üretim hattı birbiriyle entegre çalışan üç modülden meydana gelir:
- H3-Context-IR: Karmaşık çok modlu talimatları derinlemesine anlayıp H3'ün işleyebileceği Bağlam Ara Temsiline (Context Intermediate Representation) dönüştürür; nihai çıktı kalitesi için kritik öneme sahiptir.
- H3-Base: H3-Context-IR çıktısını temel alarak 768p çözünürlükte ses ve video üretir.
- H3-Regenerate-2K: 768p sonucu orijinal bağlamla birlikte yeniden modele besleyerek daha yüksek görsel aslına uygunluk ve ince detaylarla 2K çözünürlükte çıktıyı yeniden oluşturur.
Geliştirici ve Öğrenme Çıkarımları
Yazılım geliştiriciler için H3, video ile yerel stereo sesi eşzamanlı üreterek harici ses/TTS modelleri ve senkronizasyon pipeline'ları kurma ihtiyacını ortadan kaldırır. 768p temel üretim ile 2K yeniden üretim modüllerinin ayrılması, üretim ortamlarında kaynak tüketimini optimize eden iki aşamalı ölçekleme mimarisi sunar.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →