Nvidia($NVDA), aynı anda konuşan 8 kişiye kadar konuşmacıyı gerçek zamanlı olarak ayırabilen, yaklaşık 100 milyon parametreli Nemotron 3 Diarization ses modelini yayımladı. Model; toplantı tutanağı oluşturma, çağrı merkezi analizi ve ses tabanlı yapay zeka ajanları gibi alanlarda kullanılabiliyor.
Nvidia, modeli 23'ünde Hugging Face'teki bir paylaşım aracılığıyla duyurdu. Nemotron 3 Diarization, Hugging Face ve NeMo üzerinden kullanılabiliyor; tek bir modelle hem kayıt dosyalarının işlenmesini hem de gerçek zamanlı akışı destekliyor.
Konuşmacı ayrıştırma, sesi metne dönüştüren konuşma tanıma teknolojisinden farklı olarak 'kimin ne zaman konuştuğunu' belirliyor. Model, konuşmacıların gerçek kimliğini tespit etmiyor; konuşma sırasına göre speaker_1 ve speaker_2 gibi anonim etiketler atıyor.
Bu nedenle toplantı katılımcılarının bilgisi veya ayrı bir konuşmacı doğrulama modeli bulunmadığında etiketleri gerçek kişilerle eşleştirmek mümkün değil. Toplantı tutanakları, danışmanlık kayıtları ve röportaj düzenleme gibi alanlarda ses içeriğiyle konuşmacı bilgisinin birlikte yönetilebilmesi için ayrıca bir kimliklendirme sistemi gerekiyor.
Model, konuşmacı etkinliği olasılığını 10 milisaniyelik aralıklarla çıkarıyor. Birden fazla kişinin aynı anda konuştuğu örtüşen konuşmaları da işleyebiliyor. Girdi tamponu gecikmesi 0,32 saniye, 0,64 saniye, 1,04 saniye ve 30,4 saniye gibi seçeneklerle ayarlanabiliyor.
0,32 saniye, Nvidia'nın önerdiği ayarlar arasındaki en kısa gecikme süresi. Teknik olarak 80 milisaniyelik bir girdi tamponu da kullanılabiliyor ancak bu ayar doğruluk ve işlem hacmini düşürebiliyor.
Akış sırasında 'Arrival-Order Speaker Cache' özelliği kullanılıyor. Bu özellik, konuşmacılara ilk ortaya çıkış sırasına göre etiket veriyor ve sonraki ses bölümlerinde aynı etiketi koruyor. Böylece bölümler değiştiğinde konuşmacı numaralarının karışması azaltılıyor.
Nvidia, VoiceArena'nın ilk Diarization-Bench değerlendirmesinde Nemotron 3 Diarization'ın 12 sistem arasında birinci olduğunu açıkladı. İngilizce 139 konuşma ve yaklaşık 22 saatlik ses üzerinde, örtüşen konuşmalar da dahil edilerek yapılan değerlendirmede modelin konuşmacı ayrıştırma hata oranı (DER) yüzde 14,72 oldu.
İkinci sıradaki sistemin DER oranı yüzde 19,3 olarak ölçüldü. Ancak Nvidia, bunun ilk değerlendirme olduğunu ve resmi değerlendirme ile istatistiksel analiz tamamlandığında sonuçların değişebileceğini belirtti.
Nemotron 3 Diarization, önceki dört konuşmacılı Streaming Sortformer v2.1'e kıyasla desteklenen konuşmacı sayısını 8'e çıkardı. Nvidia, modeli kamuya açık ve lisanslı ses verilerini kullanarak eğittiğini, David AI'ın çok konuşmacılı ses verilerinin de eğitim setine dahil edildiğini bildirdi.
Nvidia, belirli bir değerlendirme koşulunda bu verilerin eklenmesinin ardından DER oranının yüzde 11,19'dan yüzde 10,42'ye gerilediğini ve 0,77 puanlık iyileşme sağlandığını açıkladı. Bu sonuç farklı bir değerlendirme koşulundan elde edildiği için VoiceArena'daki yüzde 14,72'lik sonuçla doğrudan karşılaştırılamaz.
Modelin bir diğer özelliği de ağırlıklarının kamuya açık olması. Hugging Face model sayfası ve Baseten, lisansı OpenMDW-1.1 olarak gösteriyor. Baseten ayrıca akış ve toplu çıkarım için dağıtım ortamı sunuyor.
Bununla birlikte dağıtım hizmeti sağlayıcısının işlem hacmi ile modelin kendi performansı ayrı değerlendirilmelidir. Konuşmacı ayrıştırma hata oranı; veri setine, gecikme süresine, örtüşen konuşmaların dahil edilip edilmemesine ve sınır toleransına göre değiştiğinden AISHELL-4 gibi diğer değerlendirme sonuçlarıyla doğrudan kıyaslanması zor.
Türkçe ve yerel ses verileriyle performansın ayrıca doğrulanması gerekiyor. Ses modelini toplantı tutanakları veya çağrı merkezlerinde kullanmak isteyenlerin yalnızca desteklenen dilleri değil, işlem gecikmesini, maliyeti ve konuşmacı etiketlerinin tutarlılığını da incelemesi gerekiyor.
Bu duyuru, kripto para veya blokzincir teknolojisiyle doğrudan bağlantılı değil. Ancak Nvidia'nın açık model ekosistemini genişletme süreci kapsamında ses işleme modellerini de yayımlamaya başladığı görülüyor.
Nvidia, büyük dil modelleri merkezli açık model stratejisini ses işleme alanına genişletti. Modelin gerçek hizmetlerde Türkçe ve çok konuşmacılı ortamlarda nasıl performans göstereceği ve lisans kapsamının nasıl uygulanacağı izlenecek.
Yorum 0