Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Grok 4.7 ve Xiaomi MiMo-V2.6-Pro, Siber Savunma Testinde 56 Puanla Ortak Lider

Güvenlik açığı düzeltme işaretleri bulunan kod inceleme materyali / TokenPost.ai

Grok 4.7 ve Xiaomi MiMo-V2.6-Pro, Cyber Index değerlendirmesinde 56 puan alarak ortak birinciliği paylaştı. Değerlendirme başına maliyet Grok 4.7 için 11,67 dolar, MiMo-V2.6-Pro için 0,18 dolar oldu.

Artificial Analysis, değerlendirme sayfasında Grok 4.7’nin ayarını ‘xhigh’ olarak gösterdi. GPT-6 Luna ise 53 puanla iki modelin ardından geldi. Başlıktaki “birinci” ifadesi tek başına liderliği değil, ortak birinciliği anlatıyor.

Cyber Index; gerçek yazılım depolarında güvenlik açıklarının bulunmasını, yeniden üretilip doğrulanmasını ve mevcut işlevlere zarar vermeden düzeltilmesini ölçüyor. Artificial Analysis, CWE-Bench-AA, DeepsecBench-AA ve CyberGym-E2E-AA puanlarının eşit ağırlıkla birleştirildiğini açıkladı. Saldırı amaçlı istismar kodu geliştirme becerisi değerlendirme kapsamında yer almıyor.

Artificial Analysis, üç testin güvenlik açığı denetimi ve düzeltme, açık tespiti ile bellek güvenliği sorunlarının bulunması, yeniden üretilmesi ve giderilmesi gibi farklı görevler içerdiğini belirtti. Bu nedenle 56 puan, çeşitli savunma görevlerinin toplam sonucunu gösteriyor; belirli bir şirketin kod tabanında veya güvenlik süreçlerinde aynı performansın alınacağı anlamına gelmiyor.

İki model toplam puanda liderliği paylaşsa da görev başına maliyetleri farklılaştı. Artificial Analysis’in açıkladığı maliyet, söz konusu kıyaslama görevlerinin ortalamasını yansıtıyor. Gerçek şirket ortamındaki maliyet, görevlerin kapsamına ve kullanım miktarına göre değişebilir.

Şirketlerin güvenlik işlerinde yapay zekâ modellerini değerlendirirken genel sıralamanın yanı sıra ihtiyaç duyulan görevlerdeki sonuçları ve maliyeti de incelemesi gerekiyor. Bu değerlendirme, kurumsal sistemlerle entegrasyon kolaylığını, operasyonel istikrarı veya gerçek kullanımın etkisini ölçmedi.

TokenPost’un Grok 4.7’nin başka bir kıyaslamada Claude’un gerisinde kaldığına ilişkin önceki haberi ile bu savunma görevi değerlendirmesi farklı ölçütlere dayanıyor. Xiaomi’nin MiMo-V2.6 serisini tanıtırken açık kaynak modellerinin performansına ilişkin iddiaları da daha önce haberleştirilmişti.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1