Yapay zekâ modellerinin başka modellerin yanıtlarını değerlendirirken kendilerine benzer ekollerin yanıtlarına daha yüksek puan verme eğilimi, çeşitli deneylerde gözlemlendi. Bu yanlılığın model sıralamalarına ve performans ölçümlerine birikimli olarak yansıyabileceği belirtiliyor.
CryptoBriefing, yapay zekâ değerlendiricilerinin kendi yanıtlarını yaklaşık %58 olasılıkla tercih ettiğini ortaya koyan bir araştırma sonucunu aktardı. Ancak haberde araştırmanın adı ve orijinal veri bağlantısı paylaşılmadığı için bu oran doğrulanmış bir araştırma sonucu olarak değerlendirilemez.
Yapay zekâ değerlendiricilerindeki yanlılığın yapısı
Chatbot Arena, iki modelin yanıtlarını anonim olarak karşılaştırıyor ve kullanıcıların daha çok tercih ettikleri yanıtı seçmesini sağlıyor. İlgili araştırma, Ocak 2024 itibarıyla 243.329 konuşma ve 50 modelden elde edilen verilerle insan tercihine dayalı model değerlendirme yapısını açıklıyor. Chatbot Arena araştırması, değerlendiricilerin insan kullanıcılar olması nedeniyle yapay zekâ değerlendirmesinden ayrılıyor.
Sorun, değerlendiricilerin insan yerine yapay zekâ modellerinden oluşmasıyla büyüyebilir. KAIST ve KRAFTON tarafından yürütülen araştırma, büyük dil modeli değerlendiricilerinin yalnızca doğruluktan değil, yanıt uzunluğu ve otoriter üslup gibi yüzeysel özelliklerden de etkilendiğini analiz etti. Araştırmaya göre iki yanıtın doğrudan karşılaştırıldığı yöntemlerde bu yanlılık daha da güçlenebilir. İlgili araştırma
IOV Labs, 6 Haziran'da yayımladığı kontrollü deneyde dört öncü model üzerinde 1.152 ikili karşılaştırma gerçekleştirdi. Dört modelin tamamı kendi ekolünden gelen yanıtları görece daha fazla tercih etti ve ortalama öz-tercih endeksi +0,14 olarak ölçüldü. GPT-4o'nun endeksi ise +0,21 olarak verildi. IOV Labs araştırması
Bununla birlikte modellerden yalnızca biri, dört model arasından kendi yanıtının yazarını gerçekten tespit edebildi. Araştırmacılar bu durumu, modelin kendi yanıtını tanıyıp kayırmasından çok kendisine benzer üslup, yapı ve ifade dağılımını daha doğal veya üstün görmesi olarak yorumladı.
Deneyde yanıtların sırası ve uzunluğuna bağlı yanlılıklar da görüldü. İlk sırada sunulan yanıtın seçilme oranı %63 olurken, yanıt uzunluğu ile değerlendirme sonucu arasındaki korelasyon katsayısı 0,98 olarak ölçüldü. Bu durum, yanıtın gerçek kalitesinden bağımsız olarak sunum sırası ve uzunluğunun sonuçları etkileyebileceğine işaret ediyor.
Liderlik tablolarının güvenilirliğine etkisi
Yapay zekâ değerlendiricisi model yanıtlarını puanladığında ve sonuçlar model sıralamalarına veya eğitim verilerine yeniden yansıtıldığında, değerlendiricinin tercihleri sıralamalarda birikebilir. Özellikle tek bir değerlendirme modelinin tekrar tekrar kullanılması, belirli üslup veya yanıt yapılarına avantaj sağlayan sonuçlar üretebilir.
AAAI'de yayımlanan 2026 tarihli araştırma, her modelin tercih yanlılığının farklı olması nedeniyle değerlendiriciye göre model sıralamalarının tutarlı olmayabileceğine dikkat çekti. Araştırmacılar, değerlendiriciler arasındaki uyuşmazlığı azaltmak için birden fazla değerlendiricinin sonuçlarını düzenleme yöntemini önerdi. AAAI araştırması
Önerilen önlemler arasında değerlendirme paneline farklı modellerin dahil edilmesi ve sonuçların insan değerlendirme örnekleriyle karşılaştırılması yer alıyor. Yanıtların sırasını değiştirerek yeniden değerlendirmek, uzunluk ve üslubun etkisini ayrı ayrı ölçmek de gerekiyor.
Topluluk deneylerinde de insanlarla yapay zekâ değerlendirmelerinin karşılaştırılması gerektiğine dair farkındalık görüldü. Bir Reddit deneyinde 29 insan ve 13 yapay zekâ değerlendiricisi 1.181 ikili karşılaştırma yaptı. Deneyi paylaşan kişi, 32 sorunun 26'sında aynı yönde tercih görüldüğünü belirtti. Ancak sonuçlar resmi bir akademik araştırmaya dayanmadığı için genellenemez. Deney sonuçları
Öz-tercih yanlılığının varlığı, değerlendirme sonuçlarının otomatik olarak yanlış olduğu anlamına gelmiyor. Modelin kendi ekolünden gelen yanıtları tercih etmesinin bazı nedenleri gerçek kalite farkları olabilir. Bu nedenle yanlılık ile kalite farkını birbirinden ayıracak ek deneylere ihtiyaç var.
Değerlendirmenin bağımsızlığı ve doğrulama altyapısına ilişkin tartışmalar daha önce, yapay zekâ değerlendiricileri için erişim ve düzenleme yetkisi ile misillemeye karşı koruma talep edilen olayda da gündeme gelmişti. Değerlendirilen şirketlerle değerlendiricilerin hangi bilgileri paylaşacağı ve sonuçların nasıl açıklanacağı da değerlendirme sisteminin güvenilirliğini etkileyebilir.
Şu ana kadar doğrulanabilen araştırmalar, yapay zekâ değerlendiricilerinde öz-tercih ile sıra ve uzunluk yanlılıklarının görülebileceğini ortaya koyuyor. Ancak bu bulgular tüm modellere ve değerlendirme ortamlarına aynı oranlarla uygulanamaz.
Sanal varlık fiyatları veya blockchain projeleri üzerinde doğrudan bir etki ortaya konmadı. Tartışmanın merkezinde, yapay zekâ modellerinin sıralamalarını ve benchmark sonuçlarını yalnızca tek bir değerlendiricinin çıktısıyla değerlendirmek yerine değerlendirici çeşitliliği, insan örnekleriyle karşılaştırma, yanıt sırasını çaprazlama ve uzunluk ile üslup yanlılıklarını birlikte test etme gerekliliği bulunuyor.
Yorum 0