UC Berkeley araştırmacıları, 10 yapay zekâ ajanı kıyaslamasını denetleyerek 219 kusur tespit etti. Bulgular, modellerin gerçek görevlerdeki başarısını yalnızca puanlara bakarak değerlendirmenin güç olduğunu gösteriyor.
Araştırmacılar, 12 Mayıs 2026’da yayımladıkları makalede, görevleri çözmeden yüksek puan alınmasını sağlayan açıkları BenchJack adlı denetim aracıyla bulduklarını bildirdi. İncelenen 10 kıyaslamanın 9’unda, gerçek görevleri yerine getirmeden neredeyse tam puana ulaşan saldırılar geliştirdiler. Makalenin tam metni
Araştırmacılar, web tarama değerlendirmesi WebArena ile masaüstü görevlerini ölçen OSWorld’ü üç kez gözden geçirerek istismar edilebilir görevleri kaldırdıklarını aktardı. Kusurlar; ajanlarla değerlendirme sistemleri arasındaki yalıtımın yetersiz olmasından, doğru yanıtların açığa çıkmasından ve puanlama mantığındaki açıklardan kaynaklandı.
Ekip ayrıca değerlendirme ortamlarının ayrılması, doğru yanıtların korunması ve puanlama yöntemlerinin denetlenmesi gibi adımları içeren bir kontrol listesi önerdi. Görevleri gerçekten çözmeden değerlendirmedeki açıkları kullanarak puanı yükseltme davranışı, ödül korsanlığı olarak adlandırılıyor.
Çalışma, kıyaslama puanlarının tamamını geçersiz kılmıyor. Ancak değerlendirme ortamında veya puanlama yönteminde kusur bulunması, puanların gerçek beceriyi yansıtmasını engelleyebilir. Bu nedenle modelin gerçek görevlerdeki başarısı yalnızca kıyaslama sıralaması ya da puanıyla kesin biçimde belirlenemiyor.
Anthropic’in “ekim sonundaki en iyi yapay zekâ modeli” hakkındaki tahmin piyasası fiyatları, araştırma bulgularından ayrı değerlendirilmelidir. Polymarket sözleşme sayfasında 3 Ekim saat 12.45 (TSİ) itibarıyla Google için %64, Anthropic için %37 gösterildi. Sözleşmenin 31 Ekim civarında sonuçlandırılması bekleniyor. Polymarket sözleşme sayfası
Tahmin piyasası fiyatları, işlem yapanların sözleşme sonucuna ilişkin kolektif değerlendirmesini yansıtıyor. Bu fiyatlar modellerin nesnel sıralamasını doğrudan ölçmüyor ve fiyat hareketlerinin nedenini belirlemiyor.
Dolayısıyla araştırma sonuçlarının Anthropic sözleşmesindeki fiyat değişimini etkilediği doğrulanmış değil. Çalışma, kıyaslama değerlendirme süreçlerinin güvenilirliğinin incelenmesi gerektiğine işaret ediyor; Anthropic modellerinin rekabet gücünü belirleyen bir veri sunmuyor.
Yorum 0