Coinbase’in geçmiş ödeme işlemleri üzerinde yaptığı değerlendirmede Opus, Sonnet ve GPT serilerinin en yeni modelleri, önceki sürümlere kıyasla daha az dolandırıcılık işlemi ve dolandırıcılık tutarı tespit etti. GPT-5.6 (sol), dolandırıcılık olarak işaretlediği işlemlerde doğruluğu artırırken toplam dolandırıcılık işlemlerini ve tutarını yakalama oranında geriledi.
Coinbase($COIN), 7 Ekim’de yayımladığı şirket içi değerlendirmede Opus 4.5 ve Opus 5’i, Sonnet 4.6 ve Sonnet 5’i, GPT-5.4 ve GPT-5.6 (sol) ile karşılaştırdı. Dokuz haftalık işlem kayıtlarından seçilen 16.140 işlem yeniden değerlendirildi. Kullanıcı sayısı 7.293, doğrulanmış dolandırıcılık işlemi sayısı 813 oldu. Modellerin risk kararlarını gerçek engelleme kararlarına dönüştürmek için kullanılan eşik aynı tutuldu.
Üç serinin de en yeni modelleri, önceki sürümlerine göre geri çağırma, F1 puanı ve dolar ağırlıklı geri çağırma ölçütlerinde daha düşük sonuç verdi. Geri çağırma, doğrulanmış dolandırıcılık işlemlerinin model tarafından bulunan oranını; dolar ağırlıklı geri çağırma ise doğrulanmış dolandırıcılık tutarının ne kadarının yakalandığını gösteriyor. F1 puanı, kesinlik ile geri çağırmayı birlikte değerlendiriyor.
GPT-5.6 (sol)’un kesinliği önceki modele kıyasla 11,5 yüzde puan arttı. Buna karşılık geri çağırma 20,7 yüzde puan, dolar ağırlıklı geri çağırma ise 21,8 yüzde puan düştü. Dolandırıcılık olarak işaretlenen işlemlerin doğruluğu yükselirken, tespit kapsamı daraldı.
Opus 5 ve Sonnet 5, dört değerlendirme ölçütünün tamamında önceki sürümlerinden düşük sonuç aldı. Opus’un geri çağırması 0,8 yüzde puan azalırken Sonnet’in geri çağırması ve dolar ağırlıklı geri çağırması sırasıyla 22,2 ve 22,9 yüzde puan geriledi. Coinbase, düşüşün model eğitim yönteminden ya da belirli bir değişiklikten kaynaklanıp kaynaklanmadığını belirleyemediğini açıkladı.
Bu değerlendirme, canlı hizmette müşterilerin uğradığı kayıpları ölçmedi. Modellerin sürümleri arasındaki farkı incelemek için geçmiş işlemler aynı koşullarda yeniden değerlendirildi. Mevcut dolandırıcılık önleme sisteminin tamamının en yeni yapay zekâ modeliyle değiştirilmesi durumundaki performans da ölçülmedi.
Coinbase, daha önce yaptığı ayrı bir çevrimiçi deneyde mevcut makine öğrenimi modelleri ve kurallara yapay zekâ incelemesi eklenmesinin ardından dolandırıcılık işlemlerinin %30, dolandırıcılık tutarının ise %22 azaldığını duyurmuştu. Bu deney, mevcut sisteme yapay zekâ incelemesinin eklenmesini kapsıyordu ve yöntem bakımından bu model sürümü karşılaştırmasından farklıydı. Şirketin önceki dolandırıcılık önleme deneyi ve yapay zekâ incelemesinin devreye alınmasına ilişkin haber ayrı deneyin sonuçlarını ele almıştı.
Coinbase, 8 Ekim’de yayımladığı başka bir değerlendirmede dolandırıcılık verileriyle ek eğitim alan Qwen3.5-9B modelinin dört tespit ölçütünün tamamında Opus 4.5’ten daha yüksek sonuç aldığını bildirdi. F1 puanı 9,6 yüzde puan daha yüksek, çevrimiçi çıkarım gecikmesi ise %55 daha kısaydı. Bu sonuç da Coinbase’in kendi verilerine ve ayrı değerlendirme koşullarına dayanıyor.
Karşılaştırma, belirli bir ödeme dolandırıcılığı veri setinde ve karar eşiğinde model sürümünü değiştirmenin tespit sonuçlarını etkileyebileceğini gösteriyor. Aynı sonuçların başka hizmetler veya gerçek zamanlı müşteri kayıpları için geçerli olup olmadığı bu değerlendirmeden anlaşılamıyor.
Yorum 0