Anthropic’in Claude Opus 5.5 modelinin yayımlanmasının ardından performans değişimlerini izleyen açık kaynaklı bir proje devreye alındı. Livenerf, modeli her gün aynı koşullarda değerlendiriyor ancak 1 Ekim itibarıyla performans düşüşü olup olmadığını gösterecek sonuçlar henüz ortaya çıkmadı.
Bireysel geliştirici ninjahawk tarafından oluşturulan Livenerf, 22 Eylül’de yayımlanan Opus 5.5’i inceliyor. Proje deposunda bunun Anthropic’ten bağımsız bir çalışma olduğu, kamuya açık kurallar ve sabit bir puanlama yöntemi kullanıldığı belirtiliyor. Ham değerlendirme kayıtları da düzenli olarak yayımlanıyor.
Opus 5.5’in yayımlanmasına ilişkin Anthropic’in önceki açıklamaları önceki haberde ele alınmıştı. Livenerf, modelin yayımlandığı dönemdeki performansını temel alarak daha sonraki ölçümlerde dağılımın aynı koşullarda değişip değişmediğini ayrıca takip ediyor.
Değerlendirme kapsamında GPQA Diamond, MMLU-Pro, rekabetçi matematik ve AIME 2025~2026’dan seçilen 2.336 soru bulunuyor. Opus 5.5’in her soruyu dört kez yanıtlamasıyla elde edilen sonuçlara göre model, soruların yaklaşık %93’ünü ilk denemede doğru yanıtladı. Soruların %97’sinde dört yanıtın tamamı doğru ya da tamamı yanlış olurken, sonuçların farklılaştığı soru sayısı 78 oldu.
Livenerf, bu 78 soruyu gerçek takip paneli olarak kullanıyor. Her zaman doğru yanıtlanan sorular model zayıflasa bile değişimi göstermiyor. Her zaman yanlış yanıtlanan sorularda da iyileşmeyi ayırt etmek zorlaşıyor. Bu nedenle her soru her gün bir kez değerlendiriliyor ve puanlama bir dil modeliyle değil, doğru yanıtla kesin karşılaştırma yapılarak gerçekleştiriliyor.
Değerlendirme dönemi 30 gün sürüyor. İlk 10 gün yayımlanmanın hemen sonrasındaki temel performansı ölçmek için kullanılıyor. Sonraki iki 10 günlük dönem ise karşılaştırılıyor. Ön kayıt belgesinde ilk temel veri döneminin 24 Eylül 2026’da başladığı belirtiliyor.
1 Ekim itibarıyla temel verilerin toplanması sürüyor. 30 Eylül’de ilk dönemde yedi günlük veri birikmişti. En erken sonuca ulaşılabilmesi için iki karşılaştırma döneminin de tamamlanması gerekiyor.
Karar ölçütleri de önceden belirlendi. Arka arkaya gelen iki 10 günlük dönemde temel veriye kıyasla farkın %99 güven aralığında sıfırı içermemesi ve değişim büyüklüğünün her iki dönemde de en az 3 puan olması gerekiyor.
Kontrol grubu olarak Claude Opus 5 kullanılıyor. Aynı değerlendirme ortamında iki model birlikte hareket ederse bu durum belirli bir modeldeki değişim yerine araç veya platform değişikliği olarak sınıflandırılıyor.
Ancak Livenerf’in hassasiyetinin sınırları bulunuyor. Livenerf’in ön kayıt belgesinde, 10 günlük dönemlerde yaklaşık 7,5 puanlık doğruluk değişiminin tespit edilebilir düzeyde olduğu öngörülüyor. Bunun altındaki dalgalanmalar istatistiksel gürültü içinde kaybolabilir.
Doğrulama sürecinde Opus 5.5’in Opus 5 ile değiştirildiği deneyde doğruluk 3,8±6,3 puan düştü ancak fark %99 düzeyinde ayırt edilemedi. Token kullanımı da %23 azaldı. Ancak bu büyüklükteki değişimin de söz konusu değerlendirme yöntemiyle doğrulanması zor oldu.
Ölçüm kanalı da sınırlı. Livenerf, API üzerinden sunulan ham modeli değil, Claude Max aboneliğinde headless Claude Code aracılığıyla sunulan Opus 5.5’i değerlendiriyor. CLI sürümü 2.1.280 olarak sabitlenmiş durumda.
Çıkarım yoğunluğu, istem, değerlendirici ve çalıştırma koşulları sabit tutuluyor. Ancak gerçek kullanıcıların karşılaştığı varsayılan ayarlar ile araç ve hafıza özelliklerindeki tüm değişiklikler ölçüme yansımıyor. Bu nedenle Livenerf’in ölçtüğü unsur, doğrudan API modeli değil, Claude Code üzerinden sunulan Opus 5.5 olarak tanımlanıyor.
Anthropic daha önce Claude Code kalitesiyle ilgili tartışmaları yalnızca modeldeki değişimlerle değil, hizmet bileşenlerindeki sorunlarla da açıklamıştı. Eylül 2025’te yayımlanan sonradan analizde altyapı hatası ve bağlam penceresi yönlendirme sorunları ele alındı. Nisan 2026’daki güncellemede ise varsayılan çıkarım yoğunluğu, düşünme önbelleği ve sistem istemindeki değişiklikler açıklandı. Anthropic’in analizleri, hizmet katmanındaki değişikliklerin kullanıcıların hissettiği kaliteyi etkileyebileceğini gösteriyor.
Livenerf, modelin ‘gizlice zayıflayıp zayıflamadığı’ sorusuna anında yanıt veren bir araçtan çok, yayımlanma sonrasında aynı koşullarda performans dağılımının değişip değişmediğini uzun vadede kaydeden bir ölçüm sistemi niteliğinde. İlk değerlendirme, 30 günlük ölçüm ve iki ayrı 10 günlük karşılaştırma dönemi tamamlandıktan sonra yapılacak.
Yorum 0