Google($GOOGL), gerçek zamanlı sesli görüşme ve gelişmiş akıl yürütme özelliklerini destekleyen iki Gemini 3.8 Live modelini tanıttı. Gemini 3.8 TTS adında ayrı bir metinden sese dönüştürme modeline Google’ın resmi kaynaklarında rastlanmadı.
Google, 15’inde geliştiricilere yönelik Gemini API ve Google AI Studio üzerinden Gemini 3.8 Live ile Gemini 3.8 Live Extended Thinking’i kullanıma sundu.
Gemini 3.8 Live, gerçek zamanlı sesli görüşmeyi sürdürürken görsel bilgileri işleyebilen bir model olarak öne çıkıyor. Geliştiriciler, görüşme sırasında API’leri ve harici araçları arka planda çağıran özellikler de geliştirebiliyor.
Gemini 3.8 Live Extended Thinking ise karmaşık akıl yürütme ve çok aşamalı görevleri yerine getirmeye odaklanıyor. Kullanıcı sesli görüşmeyi sürdürürken model ayrı görevleri işleyebiliyor.
İki model 97’den fazla dili ve aksan tutarlılığını destekliyor. Sesli girdinin yanı sıra video ve görüntüleri de gerçek zamanlı olarak işleyebiliyor.
Google, Extended Thinking modelinin Artificial Analysis Speech to Speech Quality Index’te 82,6 puanla birinci olduğunu açıkladı. Ancak bu puan Google’ın yayımladığı karşılaştırma verilerine dayanıyor ve bağımsız bir doğrulama yapılıp yapılmadığı bilinmiyor.
Bu duyuru, Google’ın resmi açıklamasında gerçek zamanlı görüşme, görsel girdi, akıl yürütme ve araç çağırma özelliklerini bir araya getirdiğini gösteriyor. Bununla birlikte Gemini 3.8 Live serisinin odağı, metni sese dönüştürmekten çok etkileşimli yapay zeka uygulamaları geliştirmek.
TTS, metni sese dönüştüren teknolojiyi ifade ediyor. Sesli girdiyi anlayıp sesli yanıt veren Gemini 3.8 Live’dan işlem süreci ve kullanım amacı bakımından ayrılıyor.
Google’ın resmi olarak tanıttığı ayrı TTS modeli Gemini 3.1 Flash TTS. Bu model, doğal dil komutları ve ifade odaklı ses etiketleriyle konuşma tarzı, hız ve duygu gibi özelliklerin ayarlanmasına olanak tanıyor.
Gemini 3.1 Flash TTS, 70’ten fazla dili ve çok konuşmacılı görüşmeleri destekliyor. Model, metin tabanlı içerikleri doğal seslere dönüştürmeye odaklanıyor.
Google Cloud belgelerinde tanıtılan Gemini-TTS, Türkçe dahil çeşitli dilleri destekliyor. Şiir, haber ve hikaye anlatımına uygun ifade odaklı okuma ile duygu, tonlama ve konuşma hızını kontrol etme özellikleri de sunuyor.
Ancak Gemini-TTS belgelerinin Gemini 3.8 TTS’nin piyasaya sürüldüğü anlamına gelip gelmediği doğrulanmış değil. Resmi ürün adları dikkate alındığında Gemini 3.8 Live serisi ile Gemini 3.1 Flash TTS ayrı ürün grupları olarak görülüyor.
Daha önce Google’ın gerçek zamanlı sesli görüşme ve gelişmiş akıl yürütme özelliklerini destekleyen iki Gemini 3.8 Live modelini tanıttığı bildirilmişti. Son doğrulama, bu modeller ile TTS teknolojisinin kullanım amaçlarını birbirinden ayırması bakımından önem taşıyor.
Google’ın Gemini 3.5 Transcribe modeli için resmi belgelerde Türkçe desteği doğrulanmıştı. Ancak Gemini 3.8 Live’ın Türkçe görüşme kalitesi ve gerçek kullanım kapsamı, yalnızca bu duyuruya dayanarak değerlendirilemiyor.
İki Gemini 3.8 Live modeli geliştiricilere Gemini API ve Google AI Studio üzerinden sunuluyor. Gemini 3.8 TTS’nin kesin ürün adı ve ayrı bir ürün olarak piyasaya çıkıp çıkmayacağı ise yeni bir resmi duyuruyla netleşecek.
Yorum 0