---
title: "Cihaz Üzerinde Çalışan Ses Klonlamalı TTS Modelini Nasıl Hazırladık?"
url: https://blog.edumints.com/cihaz-uzerinde-calisan-ses-klonlamali-tts-modelini-nasil-haz-izlne5f5
category: "Makine Öğrenmesi"
date: 2026-09-14T07:10:21.472Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/voxrtio/how-we-prepared-voice-cloning-tts-to-run-on-device-184
---

# Cihaz Üzerinde Çalışan Ses Klonlamalı TTS Modelini Nasıl Hazırladık?

Geleneksel sunucu taraflı metinden sese dönüştürme (TTS) sistemleri yüzlerce megabayt veya gigabaytlarca ağırlık boyutu gerektirirken, ses klonlama yeteneğine sahip bu model yalnızca **100 MB (fp16)** boyutundadır. Akıllı telefonlardan Raspberry Pi'ye kadar tamamen **cihaz üzerinde (on-device)** çalışan bu mimari; çıkarım anında hiçbir API veya bulut altyapısına ihtiyaç duymaz. Giriş seviyesi bir Android cihazda dahi tek çekirdekte gerçek zamandan daha hızlı (faster-than-realtime) çalışabilmektedir.

Sistem yaklaşık **45 milyon parametreden** (bir dil modeli ve bir ses dekoderi) oluşmaktadır. Her iki aşama da sıfırdan eğitilmiş ve dağıtım kolaylığı için tek bir ikili (binary) dosyada paketlenmiştir.

## İki Aşamalı Mimari Tasarımı
Model, klasik iki aşamalı şema üzerine inşa edilmiştir:
- **Dil Modeli (LM):** Metin girdisini ve yaklaşık 5 saniyelik kısa bir ses örneğini alarak sürekli (continuous) ses latent temsillerini otoregresif biçimde üretir.
- **Nöral Kodek Dekoderi:** 24 kHz kompakt sürekli latent uzayını alıp doğrudan dinlenebilir ses dalga biçimine (waveform) dönüştürür.

En kritik tasarım tercihi, yinelemeli difüzyon yerine **tek adımlı akış örnekleyicisi (single-step flow sampler)** kullanılmasıdır. Klasik difüzyon modelleri kaliteli ses üretmek için çerçeve başına birçok ileri geçişe ihtiyaç duyar. Bu durum sunucuda sorun yaratmazken, Raspberry Pi veya mobil cihazlarda performansı imkânsız kılar. Çerçeve başına tek adım zayıf donanımlarda hız kazandırır. Ayrıca nedensel (causal) yapı sayesinde ses, girdinin tamamı beklenmeden saniyenin altında ilk ses gecikmesiyle (sub-second time-to-first-audio) akışkan olarak üretilir. Klonlama profili cihaz dışında işlenirken sentezleme tamamen cihaz üzerinde gerçekleşir.

## Ne Bozuldu? #1: Tek Adımlı Örnekleyicinin Sesi Ortalama Bir Tona Düşürmesi
Difüzyon modelleri, stokastik yapının birçok adımda birikmesiyle doğallık kazanır. İşlem tek bir adıma indirildiğinde bu rastlantısallık kaybolur. Doğrudan eğitilen tek adımlı örnekleyici, karakteristik tonlar üretmek yerine eğitim setindeki kayıpları minimize eden "ortalama" bir sese yakınsar. Erken denemelerde sesler 90'lı yılların tekdüze, donuk ve robotik tonuna dönüştü.
- **Çözüm ve Pratik Çıkarım:** Örnekleyicinin yalnızca dağılımın ortalamasına değil, hedef varyansına da odaklanmasını sağlayan özel bir eğitim şeması uygulandı. Test setlerinde ses çeşitliliği doğrulanarak gerçekçi konuşma tonu yakalandı. Buradan çıkan yazılım geliştirme dersi şudur: Çıkarım (inference) hızında kazandığınız avantajı, eğitim karmaşıklığıyla ödersiniz.

## Ne Bozuldu? #2: Karışık Hassasiyet (Mixed Precision) ve 5.000 İterasyona Mal Olan Zehirli Adım
Eğitim süreci **karışık hassasiyet (mixed precision)** ile yürütülmüştür. Bu süreçte karşılaşılan en kritik sorun, tek bir hatalı veya sayısal olarak kararsız adımın (poisoned step) modelin yaklaşık **5.000 iterasyonluk** eğitim ilerlemesine mâl olmasıdır. Düşük hassasiyette meydana gelen sayısal taşmalar, ağırlık matrislerinde telafisi güç bozulmalara yol açabilmektedir.
- **Yazılım Geliştirme Çıkarımı:** Edge cihazlar için kompakt modeller eğitirken sayısal kararlılık, gradyan ölçekleme ve sıkı kontrol noktası (checkpoint) yönetiminin hayati olduğunu unutmamak gerekir. Erken tespit edilmeyen tek bir bozuk adım tüm eğitim bütçesini tüketebilir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/voxrtio/how-we-prepared-voice-cloning-tts-to-run-on-device-184)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Edge Runtime ve Production Optimizasyonu](https://edumints.com/kesfet/nextjs-ve-vercel-ai-sdk-ile-production-ai-uygulama-21y7) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/voxrtio/how-we-prepared-voice-cloning-tts-to-run-on-device-184)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/cihaz-uzerinde-calisan-ses-klonlamali-tts-modelini-nasil-haz-izlne5f5
