Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

85 Dilli Google Transcribe Modelinde Korece Desteği Doğrulandı

Dizüstü bilgisayarın yanında ses transkripsiyon cihazı ve kulaklık / TokenPost.ai

Google(GOOGL), 85'ten fazla dili otomatik tanıyan konuşmadan metne yapay zeka modeli 'Gemini 3.5 Transcribe'de Korece desteğini resmi belgelerle doğruladı. Çince kategorisinde Çin standart Mandarin lehçesi ve Hong Kong geleneksel Kantonca yer alırken, Tayvan tipi geleneksel Çince veya Tayvan Mandarini için ayrı bir madde bulunmuyor.

Google, ayın 26'sında (yerel saatle) resmi blogunda Gemini 3.5 Transcribe'i Gemini ses ürün ailesinin en yeni konuşmadan metne modeli olarak tanıttı. Canlı transkripsiyon 'gemini-3.5-transcribe-live', kayıtlı dosya işleme ise 'gemini-3.5-transcribe' modeliyle sunuluyor.

Modelin asıl amacı basit dikte değil, doğal konuşmayı belge niteliğinde metne dönüştürmek. Google, modelin konuşma sırasındaki kendi kendini düzeltmeler, duraksamalar, dolgu ifadeler ve teknik terimleri işleyerek noktalama ve biçim taşıyan bir metne çevirdiğini açıkladı.

Kullanım alanları arasında toplantı kayıtları, çağrı merkezi görüşmeleri, canlı altyazı ve sesli asistanlar sayıldı. Canlı transkripsiyon modeli, Live API üzerinden çift yönlü akış ve 1 saniyenin altında gecikme hedefliyor.

Google'ın 85'ten fazla dili kapsayan transkripsiyon modelini duyurması daha önce TokenPost tarafından aktarılmıştı. Bu yeni resmi belge doğrulaması ile Korece desteği, Çince kategorisindeki alt maddeler, işleme süresi sınırları ve konuşmacı ayırma kısıtları daha net hale geldi.

Google'ın yapay zeka geliştirici belgelerindeki desteklenen diller listesinde Korece 'ko-KR' olarak yer alıyor. Çince kategorisi, standart Mandarin 'cmn-Hans-CN' ve Hong Kong geleneksel Kantonca 'yue-Hant-HK' şeklinde gösteriliyor.

Transkripsiyon modellerinde dil listesi, çeviri desteği kapsamından farklı bir anlam taşıyor. Gerçek konuşma tanımada telaffuz, aksan, bölgesel ifade biçimi ve yazı sistemi birlikte etkili olduğundan, aynı Çince kategorisi içinde bile ayrı madde olup olmaması hizmet kalitesini ve kurumların model seçim kararını etkileyebiliyor.

Performans verileri de paylaşıldı. Google, Artificial Analysis ölçümüne göre akış (streaming) ortamında ortalama 'kelime hata oranının (WER)' yüzde 4,0, akışsız ortamda ise yüzde 2,6 olduğunu açıkladı.

FLEURS kıyaslamasında ise başlıca diller ve bölgeler bazında WER, akışta yüzde 5,50 ve akışsız ortamda yüzde 5,04 olarak belirtildi. WER, transkript sonucunun insan eliyle hazırlanmış referans metinden ne kadar farklılaştığını gösteren bir gösterge; değer düştükçe doğruluk artıyor.

Geliştiricilerin doğrudan ayarlayabileceği bir özellik de eklendi. Google'ın geliştirici belgelerine göre kullanıcılar en fazla 1.000 özel terim tanımlayabiliyor. Ancak en iyi sonucun genellikle 100 terimin altında kalındığında elde edildiği belirtiliyor.

Özel sözlük özelliği; şirket adı, ürün adı, kısaltma ve kişi isimleri gibi standart konuşma tanımada sıkça hatalı çıkan ifadeleri hedef alıyor. Özel isimlerin sık tekrarlandığı müşteri hizmetleri veya toplantı tutanağı gibi iş süreçlerinde bu özellik transkripsiyon kalitesini belirleyen bir unsur olabilir.

İşleme sınırları da belgede açıkça yer alıyor. Standart kayıtlı dosyalarda tek seferde en fazla 1 saatlik ses işlenebiliyor; konuşmacı ayırma veya kelime bazlı zaman damgası açıldığında bu sınır 30 dakikaya düşüyor.

Konuşmacı ayırma özelliği en fazla 8 kişiyi destekliyor. Ancak 3 kişi ve üzeri konuşmacı tespiti deneysel özellik olarak sınıflandırıldığından, gerçek toplantı veya röportaj ortamlarında kararlılığının ayrıca test edilmesi gerekiyor.

Google DeepMind'ın model kartına göre Gemini 3.5 Audio, Gemini 3 Pro tabanlı çalışıyor; transkripsiyon ve canlı transkripsiyon girdileri ses ve metin alıyor, çıktı ise yalnızca metin.

Model kartında, transkripsiyon modelinde de temel modelin genel sınırlamalarının görülebileceği, halüsinasyon, gecikme veya zaman aşımı yaşanabileceği belirtildi. Toplantı tutanağı, danışmanlık kaydı veya canlı altyazı hizmetine bu modeli uygulamayı değerlendiren kurumların; desteklenen diller ve doğruluk oranının yanı sıra işleme süresi, maliyet yapısı ve konuşmacı ayırma kararlılığını birlikte değerlendirmesi gerekiyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1