Google, gerçek zamanlı sesli görüşme ve görsel bilgi işleme özellikleri sunan Gemini 3.8 Live modelini yayımladı. Ancak video avatarı özelliği 'Live Avatar'ın resmi olarak kullanıma sunulduğu Google'ın resmi kaynaklarında doğrulanmadı.
Google, ayın 15'inde Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini tanıttı. İki model de sesli görüşmeyi sürdürürken görsel bilgileri işlemek ve görüşme sırasında arka planda araçlarla API'leri çağırmak üzere tasarlandı.
Kurumsal hizmetlerde Gemini Enterprise için sınırlı bir ön izleme başlatıldı. Özelliğin Gemini Enterprise müşteri deneyimi hizmetlerine de sunulması planlanıyor.
Bu duyuru, Google'ın gerçek zamanlı sesli görüşme ve genişletilmiş akıl yürütmeyi destekleyen iki Gemini 3.8 Live modelini tanıtmasına ilişkin gelişmenin devamı niteliğinde. Tartışmanın merkezinde, model lansmanından ayrı olarak video avatarı özelliğinin gerçekten birlikte sunulup sunulmadığı yer alıyor.
CryptoBriefing, ayın 24'ünde Google'ın kurumsal kullanıma yönelik gerçek zamanlı video avatarı özelliği 'Live Avatar'ı tanıttığını bildirdi. Özelliğin sese uyumlu avatar dudak hareketleri ve yüz ifadeleri, kurumsal veri yönetişimi ile SynthID filigranını desteklediği aktarıldı.
Ancak Google'ın resmi duyurusu ve geliştirici belgelerinde 'Live Avatar' adlı ayrı bir özellik veya ürün yer almıyor. Özelleştirilmiş avatarlar için izin listesi, oluşturulan tüm videolara uygulanan SynthID ve kurumsal müşterilere yönelik video avatarı çıkış takvimi de aynı şekilde doğrulanmadı.
Dil desteğine ilişkin rakamlar da kaynaklara göre farklılık gösteriyor. Google'ın Gemini 3.8 Live duyurusunda modelin görüşme sırasında 97 dili otomatik olarak algılayıp diller arasında geçiş yaptığı belirtilirken, Gemini Live API dokümanında desteklenen dil sayısı 99 olarak veriliyor.
Bu iki rakam farklı uygulama alanlarına işaret ediyor olabilir. Live API'nin 99 dil desteğinin video avatarı özelliği için de geçerli olduğuna dair bir kanıt sunulmadı.
Resmi kaynaklarda SynthID'nin uygulandığı doğrulanan içerik, yapay zekâ tarafından oluşturulan ses. Google, ses çıkışına insanların fark etmesinin zor olduğu bir filigran ekleyerek yapay zekâ üretimi içeriklerin tespit edilmesine yardımcı olduğunu açıkladı.
Bu nedenle 'oluşturulan tüm videolara SynthID uygulanıyor' açıklaması, ses filigranından ayrı değerlendirilmelidir. Aynı teknolojinin video avatarına uygulanıp uygulanmadığı için ayrıca bir duyuru gerekiyor.
Google'ın kurumsal yapay zekâ avatarı sunmadığı söylenemez. Google Vids, bir senaryoya dayanarak sunum videosu oluşturan özel yapay zekâ avatarı özelliği içeriyor. Bu araç, şirket logosu ve arka planını yansıtan videolar oluşturabiliyor.
Google Vids ile oluşturulan videolara SynthID filigranı uygulanıyor. Ancak bu hizmet bir video oluşturma aracı olarak sunuluyor ve Gemini 3.8 Live gibi gerçek zamanlı sesli görüşme gerçekleştiren avatar hizmetinden farklı çalışıyor.
Geliştiriciler Gemini 3.8 Live'ı Gemini API ve Google AI Studio üzerinden kullanabiliyor. Google, ses odaklı gerçek zamanlı etkileşim ile görsel bağlamı anlama özelliğini başlıca işlevler arasında gösterdi.
Kurumsal müşterilerin gerçek kullanım örnekleri, fiyatlandırma, hizmet bölgeleri ve video avatarının API erişim yöntemi henüz açıklanmadı. Özelliği tanıtan bir paylaşım Reddit topluluğunda paylaşılsa da yalnızca sosyal medya gönderileri resmi lansmanı veya teknik özellikleri kesinleştirmeye yetmiyor.
Şu an Google'ın resmi kaynaklarıyla doğrulanabilen kapsam, Gemini 3.8 Live ve Extended Thinking modellerinin yayımlanması ile kurumsal sesli yapay zekâ hizmetinin sınırlı ön izlemesinden oluşuyor. Live Avatar'ın resmi çıkışı ve video özelliklerinin ayrıntıları için Google'ın ek açıklama yapması bekleniyor.
Yorum 0