GPT-6 Astra, matematiksel akıl yürütme karşılaştırması FrontierMath Tier 4(v2)'de %97,6 sonuç aldı. Ancak 'Major Advance' bu puana verilen bir derece değil, ayrı bir problem çözme programındaki başarı sınıflandırmasıdır.
OpenAI, resmi açıklamasında GPT-6 Astra'nın kendi araştırma ortamı veya API üzerinden değerlendirilmesi sonucunda bu puana ulaştığını belirtti. Aynı tabloda GPT-5.6 Sol %83,0, Claude Fable 5.1 ise %87,8 sonuç aldı.
OpenAI, değerlendirme ortamı ile gerçek hizmet arasında sistem istemi ve araç farklılıkları bulunabileceğini açıkladı. Bu nedenle söz konusu puan, belirli değerlendirme koşullarında ölçülen bir sonuç olarak yorumlanmalı.
FrontierMath Tier 4(v2), araştırma düzeyindeki matematik problemlerini ölçen bir değerlendirme. Epoch AI, setin toplam 338 problemden oluştuğunu; bunların 295'inin Tier 1-3, 43'ünün ise Tier 4 kapsamında yer aldığını açıkladı.
Epoch AI, 12 Haziran 2026'da problem hatalarını düzeltme sürecinde tüm problemlerin %42'sini gözden geçirdiğini belirtti. Problem seti değiştirildiği için sonuçlar karşılaştırılırken sürüm ve problem yapısının birlikte değerlendirilmesi gerekiyor.
'Major Advance', Tier 4'e ait bir puan aralığı değil. Bu ifade, Epoch AI'nin ayrı programı 'FrontierMath: Open Problems'da matematiksel başarının önemini değerlendiren bir sınıflandırma ve 'Breakthrough' seviyesinin bir altında yer alıyor.
Epoch AI, geniş matematik alanlarındaki araştırmacıların sonucu dikkate alacağı ve çözümün ana hatlarını anlamaya çalışacağı çalışmaları 'Major Advance' olarak tanımlıyor. Bu nedenle sınıflandırma, puanın kendisinden çok problem çözümünün akademik anlamını değerlendiriyor.
Bu sınıflandırmayı alan problem 'The Core in Approval-Based Committee Elections' oldu. Epoch AI, problem için ilk çözüm modelini GPT-6 Astra olarak kaydetti ancak çözüm yöntemini 'human + AI' olarak işaretledi.
Becker, Greger ve Peters araştırma ekibi, temel fikir ile kanıtın büyük bölümünü GPT-6 Astra'ya atfetti ancak uzun süreli etkileşim gerektiğini açıkladı. Epoch AI, problem sayfasında “GPT-6 Astra problemi yalnızca basit bir istemle doğrudan çözebildiği bir durum değildi” ifadelerini kullandı.
Bu kayıt, modelin problemi bağımsız biçimde çözmesinden çok insan araştırmacılarla yürütülen iş birliği sürecinde temel fikirler sunduğunu gösteriyor. Bu nedenle yalnızca 'Major Advance' sınıflandırmasına dayanarak sonucu yapay zekânın tek başına elde ettiği bir araştırma başarısı olarak yorumlamak mümkün değil.
Problemin kendisi de belirli bir koşul içeriyordu. Araştırma ekibinin çözümü, onay oylamalı komitelerde 'core'un boş olduğu bir örneğin bulunmadığını kanıtladı.
Epoch AI, buna göre karşılaştırma probleminin başlangıçta çözülemeyecek biçimde yazıldığını açıkladı ancak politika gereği problemi çözülmüş olarak işaretledi. Problemin çözüm kaydı ile problem tasarımının uygunluğu ayrı değerlendirilmelidir.
Bu nedenle “GPT-6 Astra, FrontierMath'te ilk Major Advance'i elde etti” ifadesi, farklı gerçekleri birleştiren bir özet niteliğinde. Doğrulanan gerçekler, modelin Tier 4(v2)'de %97,6 sonuç alması ve ayrı Open Problems programındaki Major Advance problemine insan araştırmacılarla iş birliği içinde katkı sunmasıdır.
Değerlendirmenin bağımsızlığı da tartışma konusu. Epoch AI, FrontierMath'in OpenAI desteğiyle geliştirildiğini ve OpenAI'nin bazı problemlere özel erişimi bulunduğunu açıkladı.
OpenAI'nin 300 matematik probleminin hazırlanmasını talep ettiği ve problem ile çözümlere erişebildiği belirtildi. Epoch AI, OpenAI'nin çözümleri göremeyeceği ayrı bir 50 problemden oluşan set hazırladığını açıkladı.
Ayrı bir değerlendirmede başarının kapsamı daha sınırlı görüldü. FrontierMath Erdős'te GPT-6 Astra'nın resmi puanı %3 oldu. Epoch AI, sabit koşullarda 68 problemden 2'sinin çözüldüğünü açıkladı.
Tekrarlı denemeler ve daha yüksek bütçe içeren gayriresmi deneylerde 5 problem çözüldü ancak bu sonuç resmi puana dahil edilmedi. Bu durum, FrontierMath'in problem grupları ve değerlendirme koşullarına göre performansın önemli ölçüde değişebileceğini gösteriyor.
Sonuç, yapay zekânın matematiksel akıl yürütme becerisini gösteren karşılaştırma puanları ile gerçek araştırma başarısının aynı anlamda okunamayacağını ortaya koydu. Kripto para ve blok zinciri piyasalarıyla doğrudan bir bağlantı veya ilgili tokenler için bir fayda ihtimali mevcut materyallerde ortaya konmadı.
Yorum 0