Yapay Zeka·2 dk okuma·

Gemini 3.8 Live ve 3.8 Live Extended Thinking: Gerçek Zamanlı Sesli Ajanlarda Yeni Dönem

Paylaş
Yapay ZekaEdumints Blog

Gerçek Zamanlı Sesli Etkileşimde Yeni Nesil Modeller

Google, sesli yapay zeka etkileşimlerini çok daha doğal, akıcı ve akıllı hale getirmeyi amaçlayan en gelişmiş canlı diyalog modelleri Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking'i kullanıma sundu. Gelişmiş zeka seviyesi ve paralel akıl yürütme (parallel reasoning) altyapısıyla güçlendirilen bu modeller; karmaşık görevleri sesli komutlarla yürütmeyi, gerçek zamanlı görsel bağlamı çözümlemeyi ve kullanıcıyla kesintisiz bir iş birliği kurmayı mümkün kılıyor. Konuşma sırasında diller arasında anlık geçiş yapabilen sistem, kullanıcının araya girmesini (interruption) doğal biçimde yönetiyor ve bir yandan sohbet akarken diğer yandan arka planda araçları (tools) başarıyla çalıştırabiliyor.

Tanıtılan iki yeni model, sesli ajan geliştiren ekipler için iki farklı temel ihtiyaca odaklanıyor:

  • Gemini 3.8 Live: Geniş ölçekli dağıtım ve maliyet verimliliği için tasarlanmıştır; konuşma zekasını, son derece akıcı diyalog yönetimini ve gerçek zamanlı görsel bağlamı (visual grounding) dengeli bir yapıda buluşturur.
  • Gemini 3.8 Live Extended Thinking: Yüksek karmaşıklıktaki görevler ve çok adımlı akıl yürütme (multi-step reasoning) için geliştirilmiştir; derin mantıksal analiz kapasitesiyle kritik senaryolarda üstün doğruluk sunar.

Kurumsal Performans ve Benchmark Liderliği

Yeni nesil bu modeller, geliştiriciler ve kurumlar için üretime hazır (production-ready) güvenilir sesli ajanların yapı taşlarını oluşturuyor. Özellikle Gemini 3.8 Live Extended Thinking, kurumsal düzeyde görev tamamlama ve akıl yürütme yetenekleriyle öne çıkarak Artificial Analysis tarafından gerçekleştirilen "Speech to Speech Quality Index" değerlendirmesinde 82.6 puanla dünya genelinde 1. sıraya yerleşti. Otonom ajan görev tamamlama testlerinde de liderliğini kanıtlayan model, τ-Voice kıyaslamasında %68.6 ve finans sektörünün zorlu kriterlerini içeren Sierra τ-Voice-banking testinde %35.1 başarı oranına ulaştı.

Yazılım Geliştirme ve Mimari Açısından Pratik Çıkarımlar

Bu modeller, sesli yapay zeka uygulamaları geliştiren mühendisler için kritik mimari avantajlar sunmaktadır. İlk olarak, konuşma devam ederken modelin arka planda asenkron araç çalıştırması (background tool execution), geleneksel sesli sistemlerdeki bekleme sürelerini ve yapay duraksamaları tamamen ortadan kaldırır. İkincisi, gerçek zamanlı görsel zeminleme desteği sayesinde kamera veya ekran görüntüsüyle beslenen çok modlu (multimodal) asistanların geliştirilmesi kolaylaşmaktadır. Geliştiriciler; yüksek hacimli ve düşük gecikme gerektiren genel diyaloglar için Gemini 3.8 Live modelini, bankacılık ve karmaşık işlem adımları gerektiren kritik kurumsal iş akışlarında ise Extended Thinking modelini seçerek maliyet ve performans dengesini optimize edebilirler.

Yeni yetenekler; Gemini API, Google Workspace ve Gemini uygulaması üzerinden kullanıma sunulmuştur.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/)


Bu konuyu derinlemesine öğrenmek isterseniz: Live / Stream modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →