Görüntülü görüşmeye katılan 54 kişiden 26’sı, karşılarındaki yapay zekâyı (AI) gerçek bir insan olarak değerlendirdi. Tavus’un yayımladığı bir dakikalık deneyin sonucu olan bu oran, sıradan görüntülü görüşmelerde AI’ın insan sanılma oranını göstermiyor.
Tavus, etkileşimli modeli Griffin’i 1 Ekim’de tanıttı. Deneyde kullanılan Griffin-Lite, ses ve görüntüyü gerçek zamanlı olarak alıp konuşma, yüz ifadeleri, bakış ve beden hareketleri üreten bir araştırma önizleme modeli. Decrypt, Tavus’un duyurusunu ve deneyini haberleştirdi.
Tavus, katılımcılara başka bir katılımcıyla gelecek yıl için beklentileri üzerine bir dakika görüntülü görüşme yapacaklarını söyledi. Görüşmenin ardından karşılarındaki kişinin gerçek bir insan olduğunu düşünüp düşünmediklerini sordu. 54 kişiden 26’sı evet yanıtını verdi. Şirket bu oranı yüzde 48 olarak açıkladı.
Tavus, önceki bir sistemle yapılan deneyde 41 katılımcıdan 1’inin, yani yüzde 2,4’ünün karşısındakini insan olarak değerlendirdiğini belirtti. Önceki sistem; görüntü oluşturma, konuşma ve algılama işlevlerini üstlenen üç modelin birleşiminden oluşuyordu. İki deneydeki katılımcı sayıları farklıydı. Açıklanan bilgiler, aynı katılımcı grubuyla kontrollü bir karşılaştırma yapılıp yapılmadığını ortaya koymuyor.
Yüzde 48’lik sonuç, katılımcılara karşılarındaki kişinin AI olabileceği önceden söylenmeden, tek bir konu üzerine bir dakika konuşulan şirket içi deneyden geldi. Deney tasarımını ve sonuçlarını bağımsız biçimde doğrulayan bir çalışma yayımlanmadı.
Griffin-Lite, karşısındaki kişinin konuşmasını bitirmesini bekleyip yanıt vermek yerine, görüşme boyunca ses ve görüntüyü izleyerek tepki üretecek şekilde tasarlandı. Tavus, bu yaklaşımın ses tanıma, dil modeli ve ses-görüntü üretim modellerini sırayla birbirine bağlayan sistemlerden farklı olduğunu belirtiyor. Şirketin öne çıkardığı özellik, konuşmayı dinlerken sohbetin akışını ve sözsüz işaretleri de işleyebilmesi.
Griffin-Lite, NVIDIA’nın VideoFDB değerlendirmesinde üretim kategorisinde 5 üzerinden 3,83 puan aldı. Yayımlanan tabloda insan referans puanı 3,92 olurken, en yüksek puanlı sonraki kombinasyon olan Gemini 2.5 ile Anam 2,80 puanda kaldı. Algılama kategorisindeki 3,73 puanı ise insan referansı olan 4,20’nin altındaydı.
VideoFDB, gerçek görüntülü görüşmelerden seçilen 237 konuşma klibi ve 11 sözsüz etkileşim türü üzerinden AI’ın algılama ve üretim performansını ayrı ayrı değerlendiriyor. Puanlar dil modeli hakemliği yöntemiyle hesaplanıyor. Bu ölçüm, Tavus deneyinde katılımcıların karşılarındaki kişiyi insan olarak değerlendirip değerlendirmediğini sayan sonuçtan farklı.
Tavus, Griffin-Lite’ı genel kullanıma açmadı. Şirket, güvenlik önlemleri ve AI açıklama özellikleri üzerinde çalışırken, ilgili güvenlik kuruluşlarıyla iş birliği içinde modeli bazı güvenilir test katılımcılarına araştırma önizlemesi olarak sunduğunu açıkladı.
Yorum 0