Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Google 130 dil destekli ses modeli çıkardı: Diyalog bazında duygu ayarı

Ses kayıt kabininde bulunan stüdyo mikrofonu / TokenPost.ai

Google($GOOGL), her bir diyalog satırı için tonlama, duygu ve lehçe ayarı yapılabilen Gemini 3.8 Flash TTS'yi piyasaya sundu. Model, ses üretimini basit metin okumadan karakter oluşturma ve çok konuşmacılı içerik üretimine taşıyor.

Google, Gemini 3.8 Flash TTS ile Gemini 3.8 Flash-Lite TTS'yi 23'ünde tanıttı. Flash TTS ses kalitesi ve ifade gücüne, Flash-Lite TTS ise yüksek hacimli üretim ve düşük gecikmeli sesli ajanlara odaklanıyor.

Gemini 3.8 Flash TTS, doğal dil komutlarıyla yeni sesler oluşturabiliyor. Kullanıcılar her diyalog satırı için konuşma tarzı, hız, duygu ve tonlamayı belirleyebiliyor. Çok konuşmacılı diyaloglarda her konuşmacının ses rengini koruyan model, uzun ses içeriklerinde tutarlılığı artırmayı amaçlıyor.

Flash-Lite TTS, işlem hacmi ve yanıt hızının önemli olduğu görevler için tasarlandı. Google bu modelin başlıca kullanım alanları arasında yüksek hacimli içerik üretimi, gerçek zamanlı sesli ajanlar ve metinleri sesli okuma özelliklerini gösterdi.

Her iki modelde de 30 saniyelik ses örneği kullanılarak ses klonlama özelliği bulunuyor. Google, ses klonlama sürecinde rıza doğrulaması istediğini ve oluşturulan seslere yapay zekâ üretimi olduğunu belirlemeye yarayan SynthID filigranı eklediğini açıkladı.

Google geliştirici dokümanlarına göre Flash TTS 130 dili, Flash-Lite TTS ise 101 dili destekliyor. Sesli kitaplar, stüdyo anlatımları, oyun karakterleri, podcast'ler, çok konuşmacılı diyaloglar ile zor telaffuzlar ve bölgesel lehçeler öne çıkan kullanım alanları arasında yer alıyor.

Telaffuz karşılaştırmalarındaki veriler ayrı değerlendirilmelidir. Crypto Briefing, Gemini 3.8 Flash TTS'nin Artificial Analysis tarafından hazırlanan 'Pronunciation Robustness Benchmark' testinde yüzde 89,5 puanla ilk sırada yer aldığını bildirdi.

Artificial Analysis tarafından yayımlanan yöntemde, telaffuzu zor cümleler modele okutuluyor ve bağımsız değerlendiriciler cümle bazında telaffuz doğruluğunu inceliyor. Değerlendirmeye bağlama göre telaffuzu değişen kelimeler, sayılar, tarihler, ölçü birimleri, kodlar ve özel isimler dahil ediliyor.

Ancak Artificial Analysis'in kamuya açık sayfasında Gemini 3.8 Flash TTS'nin yüzde 89,5 puanı ve sıralaması doğrulanamıyor. Bu nedenle söz konusu veri, orijinal kaynak yayımlanana veya sonuç yeniden üretilebilene kadar Crypto Briefing'in aktardığı bilgi olarak değerlendirilmelidir.

Google ayrıca Gemini 3.8 Flash TTS'nin Hume AI Voice Design Benchmark'ta toplam 71,4 puan, tonlama modelleme kategorisinde ise 60,8 puanla lider olduğunu açıkladı. Hume AI, sesli yapay zekâ sistemlerini doğallığın yanı sıra talimatlara uyum, role uygunluk ve tonlama gibi farklı ölçütlerle değerlendiriyor.

Hume AI'nin kamuya açık verilerinde Gemini 3.1 Flash için görülen göstergeler; duygu, aktarım biçimi ve role uygunluk gibi unsurları ölçen ayrı bir sonuca dayanıyor. Bu nedenle söz konusu verileri Artificial Analysis'in telaffuz dayanıklılığı puanıyla doğrudan karşılaştırmak mümkün değil.

Yeni modelin kullanım amacı, Google'ın daha önce gerçek zamanlı sesli görüşme ve genişletilmiş akıl yürütme özelliklerini destekleyen iki Gemini 3.8 Live modelini tanıtmasından farklı. Live serisi sesli girdiyi anlayıp diyalog temelli yanıt vermeye odaklanırken TTS teknolojisi metni sese dönüştürüyor.

Gemini 3.8 Live ile TTS'nin ayrı modeller olduğu yönündeki önceki TokenPost haberinde de iki teknolojinin işlem süreçleri ve kullanım amaçlarının farklı olduğu belirtilmişti. Son duyuru, sesli yapay zekâ ürünlerinde gerçek zamanlı görüşme ve ses üretimi özelliklerinin ayrı modellerle genişlediğini gösteriyor.

Google, oyunlar, sesli kitaplar, podcast'ler ve etkileşimli medyayı başlıca kullanım alanları olarak sıraladı. Şirket ayrıca Figma, HeyGen, Linguana ve Wondercraft ile iş birliklerini duyurdu ancak bu ortakların gerçek kullanım kapsamı ve ticari sonuçlarına ilişkin ayrıntı paylaşmadı.

Gerçek hizmet rekabetini yalnızca telaffuz puanına göre değerlendirmek yeterli değil. Çok dilli ve lehçe işleme kalitesi, yanıt gecikmesi, üretim maliyeti, uzun ses içeriklerinde istikrar ile ses klonlamada rıza ve izlenebilirlik de dikkate alınması gereken unsurlar arasında bulunuyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1