Realtime-Venus: Asenkron Görev Delegasyonuna Sahip Tam Çift Yönlü Etkileşim Sistemi
İçindekiler
1. Kesintisiz Algı ve Yerel Konuşma Üreten Ön Uç Modelleri
Dijital ve fiziksel ortamlarda doğal etkileşim kurabilmek, kesintisiz bir algılama ve anlık tepki verme kabiliyeti gerektirir. Sesli diyaloglar akustik ve dilsel ipuçlarına dayanırken, video etkileşimi konuşmayı sürekli evrilen görsel bağlama oturtmayı zorunlu kılar. Realtime-Venus, proaktif tam çift yönlü (full-duplex) bir etkileşim mimarisi sunarak 9 milyar parametreli iki bağımsız model tanıtır: Ses-görüntü odaklı Realtime-Venus-Omni ve ses odaklı Realtime-Venus-Audio. Her iki model; sürekli algılama, konuşma kontrolü ve yerel ses üretimini kullanıcı girdileri, model çıktıları ve delegasyon olayları için paylaşılan nedensel bir zaman çizelgesinde birleştiren eksiksiz bir ön uç (frontend) olarak çalışır.
- Geliştirici Çıkarımı: Canlı akışlarda (WebRTC/WebSocket) çok modlu verileri tek bir nedensel zaman ekseninde senkronize etmek, ardışık boru hatlarının yarattığı gecikmeyi (latency) ortadan kaldırır.
2. Çift Döngülü Çalışma Zamanı (Dual-Loop Runtime) ve Asenkron Görev Yürütme
Sistem, canlı etkileşimi arka plandaki derin akıl yürütme ve araç çalıştırma süreçleriyle koordine eden çift döngülü bir çalışma zamanı (dual-loop runtime) mimarisi kullanır. Ön plandaki kullanıcı etkileşimi kesintisiz devam ederken, Realtime-Venus-Harness arka planda karmaşık görevleri asenkron olarak yürütür ve elde ettiği sonuçları süregelen diyaloğu aksatmadan konuşmaya entegre eder.
- Geliştirici Çıkarımı: Yoğun I/O gerektiren araç çağrılarını (tool calling) kullanıcı oturumunu bloke etmeden asenkron iş parçacıklarına delege etmek, gerçek zamanlı asistanlarda kullanıcı deneyimini kusursuzlaştırır.
3. Bütünleşik Eğitim Sonrası (Post-Training) Reçetesi
Geliştirilen her iki model de çevrimdışı anlamayı, proaktif tam çift yönlü etkileşim yörüngelerini ve delegasyon iş akışlarını birleştiren ortak bir eğitim sonrası tarifini benimser. Bu yöntem modellerin sadece statik cevaplar üretmesini değil, eşzamanlı konuşma dinamiklerini yönetmesini sağlar.
- Geliştirici Çıkarımı: Canlı ajan geliştirirken modelleri yalnızca metin tabanlı soru-cevap verileriyle değil; konuşma kesintilerini, bekleme anlarını ve arka plan görev yönlendirmelerini içeren gerçekçi diyalog yörüngeleriyle eğitmek kritik önem taşır.
4. Kapsamlı Başarım Kriterleri ve Kesinti Yönetimi Performansı
Değerlendirilen çevrimiçi modeller arasında Realtime-Venus-Omni, StreamingBench (%70,2), OVO-Bench (%64,7) ve Daily-Omni (%81,3) dahil olmak üzere sekiz video kıyaslamasının altısında en yüksek skora ulaşmıştır. Sekiz ses anlama ve sözlü soru yanıtlama testinde ise Realtime-Venus-Audio; MMAU (%78,0), MMAU-Pro (%63,2), Llama Questions (%83,8) ve Speech CMMLU (%67,8) metriklerinde liderliği alırken, VoiceBench AlpacaEval'de 4,81'lik en iyi skoru yakalamıştır. Full-Duplex-Bench v1.5 üzerinde model, kullanıcı kesintilerine %75 oranında yanıt vermiş; geri bildirim mırıltılarında %97, başkasına yönelen konuşmalarda %88 ve ortam gürültüsünde %86 konuşmayı sürdürme oranına ulaşarak Gemini 3.1 Live ve GPT-4o modellerini geride bırakmıştır.
- Geliştirici Çıkarımı: Tam çift yönlü sistemlerde kullanıcı araya girdiğinde yanlış kesilmeleri (false barge-in) önlemek ve ortam gürültüsünü doğru filtrelemek, sesli yapay zeka arayüzlerinin üretim ortamındaki güvenilirliğini belirler.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Live / Stream modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →