LLM·2 dk okuma·

AuK: Ses Üretimi ve Düzenlemesinde Açık Kaynaklı Temel Model

Paylaş
LLMEdumints Blog

Birleşik Arayüz ve 5 Temel Görev Ailesi

AuK, konuşma üretimi (speech generation) ve ses düzenleme (speech editing) süreçlerini doğal dil talimatları ile ses bağlamı üzerinden ortak bir arayüzde birleştiren açık kaynaklı bir temel modeldir. Geleneksel ses boru hatlarında farklı modellerle çözülen görevleri tek çatı altında toplamak amacıyla, yaklaşık 3,03 milyar talimat-ses örneği ve 1,95 milyon saatlik etkin denetimli veri kümesi oluşturulmuştur. Model, bu kapsamlı veri üzerinde 5 temel görev ailesini öğrenir:

  • Ses Üretimi (Speech Generation): Doğal dil yönlendirmeleriyle sıfır atımlı (zero-shot) konuşma üretimi.
  • İçerik Düzenleme (Content Editing): Konuşma metnindeki belirli bölümleri ekleme, çıkarma veya değiştirme.
  • İyileştirme ve Ayrıştırma (Enhancement and Separation): Arka plan gürültüsünü temizleme ve ses kaynaklarını ayrıştırma.
  • Paralinguistik Düzenleme (Paralinguistic Editing): Duygu durumu, konuşma ritmi, tonlama ve vurguları kontrol etme.
  • Akustik Düzenleme (Acoustic Editing): Ortam akustiği, oda yankısı ve mikrofon profili değişikliklerini yönetme.

Hibrit Mimari ve İki Aşamalı Eğitim Stratejisi

AuK, anlamsal kavrayış ile yüksek kaliteli ses üretimini bağlamak için üç ana bileşenden oluşan hibrit bir mimari kullanır:

  • Semantik Koşullandırma: Giriş talimatlarını anlayan ve işleyen çok modlu büyük dil modeli (Multimodal LLM).
  • Akustik Koşullandırma: Konuşma, genel ses efektleri ve müzik üzerinde ortaklaşa eğitilmiş akustik VAE.
  • Üretim Dönüştürücüsü: Çift akışlı MMDiT bloklarının ardından birleşik tek akışlı DiT bloklarını çalıştıran hibrit "rectified-flow Transformer".

Modelin eğitimi, önce yalnızca üretime odaklanan bir ısınma (warm-up) evresiyle başlar ve ardından ortak üretim-düzenleme ön eğitimiyle derinleşir. Eğitim sonrası (post-training) süreçte ise açık uçlu düzenleme görevleri için insan geri bildirimiyle tercih optimizasyonu, konuşma üretimi içinse ödül tabanlı pekiştirmeli öğrenme (RL) uygulanır.

AuK-Flash ve Geliştiriciler İçin Pratik Çıkarımlar

Üretim ortamlarında ses modellerinin yaygınlaşmasındaki en kritik darboğaz çıkarım (inference) maliyetidir. AuK araştırmacıları, modeli "consistency initialization" ve göreve yönlendirilmiş "Decoupled DMD" teknikleriyle damıtarak AuK-Flash modelini geliştirmiştir:

  • Sınıflandırıcıdan bağımsız yönlendirmeye (CFG) ihtiyaç duymadan yalnızca 4 adımda çıkarım gerçekleştirir.
  • Eşleşen donanım koşullarında tam modele kıyasla 4.5 kat saf hızlanma (wall-clock speedup) sunar.

Deneysel sonuçlar, AuK'un sıfır atımlı üretimde ve talimat güdümlü düzenlemede lider performans sergilerken, sinyal seviyesindeki restorasyon görevlerinde de son derece rekabetçi kaldığını doğrulamaktadır. Yazılım geliştiriciler açısından AuK, sesli asistanlar ve medya düzenleme araçları geliştirirken birden fazla dar kapsamlı modeli zincirleme çalıştırma zorunluluğunu ortadan kaldırır; açık kaynak kod ve ağırlıkları sayesinde yerel altyapılarda güvenle ölçeklenebilir çözümler kurmayı sağlar.

Orijinal makaleye buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →