Grok 4.7, kodlama değerlendirmesinde akıl yürütme düzeylerine göre ilk üçte yer aldı. Ancak jüri kadrosu değiştiği için puanlardan hareketle diğer modellerden daha iyi kod yazdığı sonucuna varmak güç.
VulcanBench, Frontier v4 değerlendirme sonuçlarını 4 Ekim’de yayımladı. Grok 4.7, Cursor’ın kodlama ajanı CLI’ında 23 görevi tamamladı. En yüksek akıl yürütme ayarında 93,15 puanla birinci, yüksek ayarda 92,71 puanla ikinci, orta ayarda 92,30 puanla üçüncü oldu. Düşük ayarda ise 89,42 puanla 12. sırada yer aldı.
Akıl yürütme ayarı yükseldikçe tamamlanan görev sayısı arttı, ancak görev süreleri de uzadı. Düşük ayarda 23 görevin 18’i geçildi ve görev başına ortalama 20,2 dakika harcandı. En yüksek ayarda 23 görevin tamamı geçilirken ortalama süre 28,5 dakika oldu. Orta ayarda 21 görev geçildi; bir görev süre sınırı içinde tamamlanamadı.
Bu değerlendirme, modeli tek başına ölçmek yerine Grok 4.7 ile Cursor çalışma ortamının birlikte performansını ölçtü. Puanlamada işlev doğruluğunun yanı sıra kod kalitesi, karmaşıklık ve güvenlik kontrolleri de dikkate alındı. Toplam puanın yüzde 33’ünü oluşturan kod kalitesi; okunabilirlik ve bakım kolaylığı gibi ölçütlerle model hakemler tarafından değerlendirildi.
Hakem yöntemi de modellerin puanlarını karşılaştırmayı etkileyebilir. VulcanBench, diğer modellerin kod kalitesini değerlendirirken hakem olarak Grok 4.6’yı kullandı; Grok 4.7 değerlendirmesinde ise bunun yerine GPT-6.1 Sol’u görevlendirdi. Aynı teslimler puanlandığında GPT-6.1 Sol’un verdiği puanlar Muse Spark 1.3’ün puanlarından 5,4 ila 6,3 puan daha yüksekti. VulcanBench, bu farkın Grok 4.7’nin genel puanını diğer modellerle doğrudan karşılaştırmayı sınırladığını belirtti.
Ortak hakem Muse Spark 1.3’ün puanları esas alındığında da Grok 4.7 orta, yüksek ve en yüksek ayarlarda üst sıralarda kaldı. Düşük ayarda ise Claude Fable 5.1’in gerisinde yer aldı. Hakem kadrosu eşitlendiğinde yayımlanan genel sıralama ve bazı sonuçlar değişebilir.
Görev başına maliyet hesaplanmadı. VulcanBench, Grok 4.7 için bir fiyat listesi bulunmadığını ve testlerin Cursor aboneliği üzerinden yürütüldüğünü, bu nedenle görev bazında maliyetin belirlenemediğini açıkladı. Dolayısıyla yalnızca puanlar ve çalışma süreleri, geliştirme ekiplerinin maliyet tasarrufu sağlayıp sağlamadığını göstermiyor.
xAI, Grok 4.7’yi 21 Eylül’de tanıtırken modelin Grok 4.6’dan daha büyük bir temel model kullandığını açıkladı. Şirketin açıkladığı API fiyatı, 1 milyon girdi token’ı başına 2 dolar (yaklaşık 2.686 TL), 1 milyon çıktı token’ı başına 6 dolar (yaklaşık 8.058 TL). Bu fiyatlar VulcanBench testinde görev başına oluşan maliyeti ifade etmiyor.
xAI, lansman materyallerinde CursorBench 4.0 gibi başka değerlendirmelerin sonuçlarını da paylaştı. Ölçütler ve çalışma koşulları farklı olduğundan bu sonuçları Frontier v4 puanlarıyla doğrudan karşılaştırmak güç. TokenPost’un Grok 4.7’nin başka bir karşılaştırmada Claude’un gerisinde kaldığına ilişkin haberi de her değerlendirmenin koşullarını ayrı ele almak gerektiğini gösteriyor.
Sonuçlar, Grok 4.7’nin belirli kodlama görevlerinde ve Cursor ortamında yüksek puan aldığını ortaya koyuyor. Gerçek geliştirme işlerinde performansını ve maliyet verimliliğini değerlendirmek için görev türleri ile çalışma koşullarının eşitlendiği karşılaştırmalara ihtiyaç var.
Yorum 0