Alibaba(BABA) çatısı altındaki Qwen3.8-Max modelinin açık tarama testinde maliyet avantajı sağladığı öne sürüldü. Ancak testi yürüten siber güvenlik şirketi Aikido'nun yayımladığı raporda bu modele dair sonuçlara yer verilmedi.
Çinli blok zinciri medyası BlockBeats, 5'inde Qwen3.8-Max'in üç kez çalıştırılan açık tarama testinde rakip modellerle benzer performans gösterdiğini aktardı. Habere göre toplam maliyet 821 dolar olarak hesaplandı; bu rakam Claude Opus 5 ve GPT-5.6 Sol'un yaklaşık yarısına denk geliyor.
Aikido, 16 Temmuz'da yayımladığı ve 27 Temmuz'da güncellediği kıyaslama testinde GitHub Advisory veritabanında kayıtlı 26 CVE'yi hedef alarak 13 yapay zeka modelini üçer kez çalıştırdı. Test listesinde OpenAI'nin GPT-5.4, GPT-5.5 ve GPT-5.6 serisi ile Anthropic'in Claude Haiku ve Claude Opus ailesi yer aldı.
xAI'nin Grok-4.5'i, Google'ın(GOOGL) Gemini serisi ve açık ağırlıklı model GLM-5.2 de teste dahil edildi. Qwen3.8-Max ise Aikido'nun yayımladığı model listesinde bulunmuyor.
Açıklanan sonuçlara göre GPT-5.6, 26 CVE'den 23'ünü yeniden tespit ederek yüzde 88,5'lik tekrar bulma oranıyla en yüksek performansı gösterdi. Claude Opus ailesi 15 ile 18 arasında açık bulurken Grok-4.5 20 açığı yakaladı.
19 Temmuz'da listeye eklenen Kimi K3 de 23 açığı bularak GPT-5.6 ile aynı üst sıraya yerleşti. Aikido, Kimi K3'ün test maliyetinin GPT-5.6 Sol'a kıyasla dört kat daha düşük olduğunu belirtti.
Test, modellerin sıradan bir sohbet botu gibi sorgulanmasıyla değil, farklı bir yöntemle yürütüldü. Aikido, yapay zekanın gerçek kod depolarını taramasını ve şüpheli akışları takip etmesini sağlayan bir kod analiz düzeneği içinde her modeli çalıştırdı.
Değerlendirmede aynı modelin üç kez çalıştırılıp en az bir kez bulduğu açıkların toplandığı 'pass@3' yöntemi kullanıldı. Her çalıştırmada kaçırılan açıklar değişebildiğinden tek seferlik sonuçtan çok tekrarlı çalıştırmayla ortaya çıkan tespit kapsamına bakılıyor.
Tekrarlı çalıştırmalarda model çağrı maliyeti de toplam denetim maliyetini doğrudan etkiliyor. Tek bir çalıştırmanın performansı kadar tekrar sayısı, düzenek tasarımı ve yanlış pozitif ile eksik tespitleri ayıklayan doğrulama süreci de birlikte karşılaştırılması gereken unsurlar arasında.
Qwen Code belgelerine göre qwen3.8-max ismi qwen3.8-max-preview sürümünü işaret ediyor. SiliconANGLE'ın 19 Temmuz'da aktardığına göre, daha önce açıklanan Qwen3.8-Max'in toplam parametre sayısı 2,4 trilyon olarak paylaşılmıştı ancak aktif parametre sayısı ve lisans koşulları gibi bilgiler kamuoyuyla paylaşılmadı.
Aikido'nun kıyaslama testi, genel yazılımlarda bilinen CVE'leri hedef aldı. Akıllı kontrat, borsa altyapısı ve cüzdan güvenliğine yönelik açıkların ayrı test edildiği bir sonuç rapora dahil edilmedi; bu nedenle açıklanan rakamların blok zinciri güvenlik denetimi performansı olarak yorumlanması güç.
Blok zinciri alanında yapay zekayı gerçek kod incelemesine dahil etme girişimleri sürüyor. 150 Bitcoin(BTC) kod deposunu kapsayan yapay zeka güvenlik taraması ve Ethereum(ETH) uzlaşı istemcisindeki açık tespiti örnekleri de daha önce kamuoyuyla paylaşılmıştı. Bu örneklerde de yapay zekanın önerdiği adayları gerçek açık ve yanlış pozitif olarak ayırma sürecinin kritik olduğu vurgulandı.
Yorum 0