Ne Söylemiştim? Full-Duplex Ses Modellerinde Self-Listening (Kendi Kendini Dinleme)
İçindekiler
Giriş ve Temel Sorun: Asenkron Akış ve Çapa Kesintisi (Anchor Interruption)
Tam çift yönlü (full-duplex) sesli dil modelleri, geleneksel bas-konuş sistemlerinin aksine aynı anda hem dinleme hem de konuşma yeteneğine sahiptir. Bu kabiliyet, doğal insan diyaloglarında sıkça karşılaşılan söz kesmelerin (interruptions) ve onaylama sesleri gibi araya girmelerin (backchannels) akıcı bir şekilde yönetilmesine imkân tanır.
Buna karşın, sesli etkileşim mimarilerinde metin üretimi, konuşma sentezi (TTS) ve sesin kullanıcıya oynatılması süreçleri birbirinden bağımsız ve asenkron olarak ilerler. Bu asenkron yapı nedeniyle, modelin dahili durumunda söylediğini varsaydığı içerik ile kullanıcının cihazında fiilen oynatılan ses akışı birbiriyle örtüşmeyebilir. Kullanıcı araya girdiğinde, model çoktan cümlenin sonunu üretmiş olsa bile kullanıcı sadece ilk kelimeleri duymuş olabilir. Modelin, kullanıcıya fiilen ulaşan konuşmanın farkında kalarak kesintiden sonra konuşmayı toparlayabilmesi problemine çapa kesintisi (anchor interruption) denir.
Çözüm: Self-Listening (Kendi Kendini Dinleme) Mekanizması
Söz konusu senkronizasyon ve toparlanma sorununu çözmek amacıyla araştırmacılar Self-Listening adı verilen tam çift yönlü modelleme yaklaşımını sunmaktadır:
- Çoklu Akışların Harmanlanması: Kullanıcı konuşması, modelin ürettiği metin token'ları ve kullanıcıya dinletilen ses akışı tek bir modelleme sürecinde harmanlanır (interleaving).
- Gerçekleşen Sesin Geri Beslenmesi: Kullanıcının hoparlöründen çıkan gerçekleşmiş ses çıktısı, modele anlık bir girdi akışı olarak geri beslenir.
- Duyulan Sese Çapalama: Model, kesinti sonrasındaki toparlanma sürecini dahili metin tahminlerine değil, kullanıcının fiilen duyduğu içeriğe dayandırarak konuşmayı güvenilir biçimde çıpalar.
Değerlendirme: AnchorSpeech Kıyaslama Kümeleri
Yaklaşımın başarısını ölçmek amacıyla homojen eğitim ve test bölümlerine sahip AnchorSpeech koleksiyonu geliştirilmiştir:
- Sıralı Yanıt Takibi: Yapılandırılmış ve belirli bir sırada ilerleyen yanıtlardaki maddelerin hangilerinin fiilen seslendirildiğini adım adım takip eder.
- AnchorSpeech-test: Modelin, kesintiden hemen önce kullanıcıya ulaşmış en son tamamlanan maddeyle tutarlı biçimde yanıt vermeyi sürdürüp sürdüremediğini değerlendirir.
- Deneysel Bulgular: Deneyler, self-listening mekanizmasına sahip modellerin, geleneksel full-duplex temel modellere kıyasla belirgin şekilde daha üstün çapalama performansı sergilediğini ortaya koymaktadır.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
Gerçek zamanlı sesli diyalog sistemleri ve asistanlar geliştiren mühendisler için bu mimariden çıkarılacak önemli dersler bulunmaktadır:
- İstemci-Sunucu Senkronizasyonu: LLM token üretim hızı ile ses oynatma hızı arasındaki fark mutlaka yönetilmelidir. İstemcideki ses oynatma tamponu (playback buffer) durumu, arka uçtaki model durumuna geri bildirilmeli ve asenkron sapmalar önlenmelidir.
- Dinamik Bağlam Budama: Kullanıcı söz kestiğinde modelin bağlam penceresi (context window), üretilmiş metne göre değil, kullanıcının kulağına fiilen ulaşmış son ses parçacığına göre dinamik olarak hizalanmalıdır.
- Sıralı Durum Takibi: Sıralı talimatlar veya adımlar aktarılırken, tamamlanan son maddenin tespiti doğru yapılmalı; kesinti sonrasında gereksiz tekrarlara düşülmeden akış kaldığı yerden sürdürülmelidir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.05592)
Bu konuyu derinlemesine öğrenmek isterseniz: Live / Stream modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →