Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Claude Sonnet 5.5, Agent Arena’da 3. sırada: GPT-6 Astra’ya farkı 0,25 puan

Sıralama ve performans puanlarının bulanık göründüğü değerlendirme tablosu / TokenPost.ai (macro)

Claude Sonnet 5.5 (Max), Agent Arena’nın yayımladığı sıralamada net iyileştirme puanı yüzde 12,52 ile üçüncü oldu. Dördüncü sıradaki GPT-6 Astra (Max) ile arasındaki fark 0,25 yüzde puanında kaldı; bu fark Sonnet 5.5’in hata payından daha düşük.

Arena.ai, 2 Ekim’de yayımladığı tabloda Claude Pebble 5.1’in (Max) yüzde 14,31 ile ilk, Claude Opus 5.5’in (High) ise yüzde 13,82 ile ikinci sırada yer aldığını bildirdi. GPT-6 Astra (Max) yüzde 12,27 puan aldı.

Sonnet 5.5’in hata payı ± yüzde 3,09. Sonuç, modelin bu değerlendirmede üst sıralarda yer aldığını gösteriyor; ancak GPT-6 Astra’dan kesin biçimde daha iyi performans gösterdiği şeklinde yorumlanması güç.

Agent Arena, genel soru-cevap tercihi değerlendirmelerinden farklı bir yöntem kullanıyor. Arena.ai, gerçek ajan görevlerindeki görev başarısı, kullanıcı geri bildirimi ve araç kullanımı gibi çeşitli sinyalleri ortalama bir orkestratörle karşılaştırarak net iyileştirme puanını hesapladığını açıkladı. Bu puan, ajan sistemlerinin görev performansındaki iyileşmeyi özetliyor; modelin her işte diğerlerinden üstün olduğunu göstermiyor.

Sıralama tablosunda performans puanlarının yanı sıra maliyet ve çıktı miktarı da yer aldı. Sonnet 5.5’in görev başına medyan maliyeti 2,76 dolar (yaklaşık 3.754 won), medyan çıktı miktarı ise 115.800 token oldu. Anthropic, token fiyatını 1 milyon girdi tokenı için 2 dolar (yaklaşık 2.720 won), 1 milyon çıktı tokenı için 10 dolar (yaklaşık 13.600 won) olarak açıkladı. Görev başına maliyet kullanım miktarına ve görevin içeriğine göre değişebileceğinden, gerçek maliyet verimliliğini yalnızca token fiyatlarına bakarak değerlendirmek zor.

Anthropic, Sonnet 5.5’i 28 Eylül’de tanıtırken kodlama ve çok aşamalı görevlerdeki performansını öne çıkardı. Şirketin kendi değerlendirmesi ile Agent Arena sıralaması farklı ayar ve ölçütlere dayanıyor; bu nedenle aynı gösterge üzerinden doğrudan karşılaştırılamıyor. Ajan modellerini karşılaştırırken performans sıralamasının yanında gerçek görevlerin maliyetini ve token kullanımını da incelemek gerekiyor. Bu kapsamda, daha önce yayımlanan GPT-6 Sol’un Agent Arena puanı ve fiyatı da karşılaştırma için bir referans sunuyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1