DevOps·3 dk okuma·

Açık TTS Sıralaması: Çok Dilli Metinden Sese ve Ses Klonlama için Ölçeklenebilir Değerlendirme

Paylaş
DevOpsEdumints Blog

Açık Kaynak TTS Ekosisteminde Değerlendirme Darboğazı

Açık kaynaklı metinden sese (TTS) modellerinin geliştirilme temposu olağanüstü bir seviyeye ulaştı. Hugging Face Hub üzerinde (30 Eylül 2026 itibarıyla) 8 binden fazla TTS modeli kullanıma sunulmuş durumdadır. Ancak değerlendirme yöntemleri bu hıza yetişememiş; parçalı ve standartlaşmamış olarak kalmıştır. Bu alandaki altın standart geleneksel olarak MOS veya MUSHRA gibi insan tercihi puanlarıdır.

Topluluk için faydalı referans noktaları oluşturan öne çıkmış bazı arena tabanlı liderlik tabloları şunlardır:

  • TTS Arena v2
  • Artificial Analysis Voice Arena

Bu arenalar, kullanıcılara iki modelin ses çıktılarını dinletip birini seçmelerini isteyerek modelleri kıyaslar. Yeterli oy toplandıktan sonra, genellikle Bradley–Terry modeliyle bir Elo puanı hesaplanarak modeller sıralanır. İnsan tercihi nihai karar mercii olsa da, bu arenalar model çıkış hızına ayak uyduracak şekilde ölçeklenememektedir.

Ayrıca açık kaynaklı modeller bu arenalarda yeterince temsil edilmemektedir: 30 Eylül 2026 itibarıyla Artificial Analysis üzerindeki 92 modelden yalnızca 16'sı açık ağırlıklıdır; benzer bir durum Voice Arena için de geçerlidir. Bunun sebebi pratik engellerdir: Ticari bir API modelini eklemek yalnızca bir anahtar gerektirirken, açık bir modelin arena operatörü tarafından barındırılması ve sunulması gerekir. Ticari sağlayıcıların sıralamalarda yer alma motivasyonu da daha yüksektir. Diğer bir kısıt ise oylayıcı tutarlılığıdır; Herakleitos'un "Bir insan aynı nehirde iki kez yıkanamaz" sözünde olduğu gibi, seçmen tercihleri zamanla değişir.

Açık TTS Liderlik Tablosu ve Nesnel Metrikler

Bu ölçekleme sorununa çözüm olarak geliştirilen Açık TTS Liderlik Tablosu (Open TTS Leaderboard), modelleri tamamlayıcı performans boyutlarında nesnel metriklerle değerlendirir:

  • Anlaşılırlık (Intelligibility): Açık ASR sıralamasında zirvede yer alan Qwen3 ASR modeli kullanılarak, istem metni ile üretilen sesin transkripti arasındaki kelime ve karakter hata oranları (WER ve CER).
  • Hız (Speed): H200 GPU'da çevrimdışı toplu çıkarım için ters gerçek zaman faktörü (RTFx); H200 GPU ve CPU üzerinde tekil iş yükü (batch size 1) akış gecikmesini ölçen ilk sese ulaşma süresi (TTFA).
  • Konuşmacı Benzerliği (Speaker Similarity): Üretilen ses ile referans ses klibinin WavLM konuşmacı gömmeleri (embeddings) arasındaki kosinüs benzerliği (SIM).

Yazılım Geliştiriciler ve Sistem Tasarımı Açısından Çıkarımlar

Nesnel metriklere dayalı bu yaklaşım, model değerlendirme sürecini haftalardan birkaç saate düşürür. Tablo insan tercihinin yerini almasa da (WER anlaşılabilirlik, SIM ise kimlik korunumunu modeller; doğallık veya ifade zenginliğini doğrudan ölçmez), geliştiriciler için kritik bir mühendislik rehberi sunar.

Sesli asistan veya canlı müşteri temsilcisi gibi gerçek zamanlı akış (streaming) mimarilerinde ilk sese ulaşma süresi (TTFA) gecikmeyi yönetmek için temel kriterdir; toplu seslendirme hatlarında ise RTFx donanım verimliliğini optimize eder. Geliştiriciler bu nesnel metrikleri MLOps ve CI/CD regresyon testlerine entegre edebilir, tescilli API bağımlılığı yerine kendi altyapılarında çalışacak açık kaynak modelleri hız ve benzerlik dengesine göre nesnel biçimde seçebilirler. Ayrıca bu metrikler, oylama tabanlı arenalara hangi modelleri dahil edecekleri konusunda yol gösterir. Topluluk geri bildirimleriyle geliştirilmesi hedeflenen bu sistem, ekosistemi güçlendirmektedir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →