Anthropic’in iç ölçümlerine göre Claude, model araştırma ve geliştirme çalışmalarının Ağustos 2026’da %26’sını oluşturdu. Artificial Analysis endeksinde Anthropic öne çıkarken, kullanıcıların tercih ettiği yanıtları sıralayan Arena’da Google ilk sırada yer aldı.
Air Street Capital’den Nathan Benaich, dokuzuncu yıllık “State of AI Report 2026” raporunu 8 Ekim’de yayımladı. Yapay zekâ araştırmalarını, sektörü, jeopolitiği, güvenlik ve politikaları ele alan rapor; Anthropic, OpenAI ve Google’ı başlıca rakipler olarak gösterdi. 2018’de yayımlanmaya başlayan rapor, her yıl yapay zekâ alanındaki değişimleri derliyor ve önceki öngörüleri yeniden değerlendiriyor.
Raporda Anthropic’in öne çıktığı ölçüm, Artificial Analysis’in Intelligence Index endeksi oldu. Endeks; akıl yürütme, bilgi, matematik ve programlama gibi çeşitli değerlendirmelerin sonuçlarını bir araya getiriyor. Kullanıcıların tercih ettiği yanıtları ölçen Arena sıralamasında ise Google önde yer aldı.
İki sonuç farklı ölçüm hedeflerine ve yöntemlerine dayanıyor. Bu nedenle sıralamalardan birini tüm modellerin genel üstünlüğü şeklinde yorumlamak güç. Göstergeleri karşılaştırırken değerlendirme ölçütleri ve kullanılan sürümler de dikkate alınmalı.
Raporda model sıralamalarının yanı sıra yapay zekânın Ar-Ge çalışmalarına katkısı, robotik, akıl yürütme ve siber güvenlik de ele alındı. Akıl yürütme, eğitimi tamamlanmış bir modelin gerçek talepleri işleyerek sonuç üretme sürecini ifade ediyor. Yapay zekâ ajanları görevleri sırasında modeli tekrar tekrar çağırdığında, model geliştirme maliyetlerinin yanında çalıştırma için gereken işlem gücü ve altyapı da önem kazanıyor.
Rapora göre Claude’un, Anthropic’in tanımladığı ölçüm ortamında takip edilen model Ar-Ge çalışmalarındaki payı Şubat 2026’da %1’in altındayken Ağustos’ta %26’ya yükseldi. Bu oran, Anthropic’in tanımladığı görev ve denetim ortamına dayanıyor. Yapay zekâ araştırmalarının tamamının %26’sının yürütüldüğü ya da modelin araştırmayı bağımsız biçimde yaptığı anlamına gelmiyor.
Raporun yazarları, sürekli ve tamamen otonom öz gelişim aşamasına henüz ulaşıldığının kanıtlanmadığını belirtti. Claude’un Ar-Ge çalışmalarına katılım oranı ile modelin bağımsız araştırma yeteneği ayrı konular olarak değerlendiriliyor.
Rapor, geçen yılki 10 öngörüyü de yeniden değerlendirdi: İkisi doğru çıktı, beşi kısmen isabetli bulundu, üçü ise gerçekleşmedi. Veri merkezlerine yönelik karşıt hareketler görülse de bunların kasım seçimlerine etkisi doğrulanmadığı için ilgili öngörü kısmen isabetli sayıldı.
Claude’un Ar-Ge çalışmalarına katılım oranı ve tam öz gelişim aşaması hakkındaki önceki haberimiz de raporun ele aldığı değişimle bağlantılı. Rapordaki oran, Anthropic’in tanımladığı çalışmalar içindeki payı gösteriyor; yapay zekâ araştırmalarının genel otomasyon oranını ifade etmiyor.
Yorum 0