OpenAI'nin GPT-6 Astra modeli, kodlama benchmark'ında Anthropic'in Claude Fable 5.1 modelinden daha yüksek puan aldı. Ancak yalnızca iki şirketin kendi açıkladığı değerlendirme sonuçlarına bakarak, kapalı modellerle açık kaynak ve açık ağırlıklı (open-weight) modellerin tamamı arasındaki performans farkını değerlendirmek mümkün değil.
Anthropic, 1 Eylül'de Claude Fable 5.1'i tanıttı. Fable 5.1, uzun süreli kodlama ve bilgi işi yapabilecek şekilde tasarlanan bir model; tüm kod tabanını işleyebilme, test yazabilme ve tarayıcı kontrolü gibi özellikleriyle öne çıkarıldı.
Fable 5.1'in API fiyatlandırması, 1 milyon giriş token'ı başına 10 dolar (yaklaşık 13.390 won), 1 milyon çıkış token'ı başına ise 50 dolar (yaklaşık 66.950 won) olarak belirlendi. Önbellek okuma fiyatı ise 1 milyon token başına 0,25 dolar (yaklaşık 335 won). Anthropic, genel görev maliyetlerinin yaklaşık yüzde 25, ajan tipi (agentic) görev maliyetlerinin ise en fazla yaklaşık yüzde 45 azaldığını açıkladı.
OpenAI ise 3 Eylül'de GPT-6 Astra'yı tanıttı. Astra; kodlama, tarayıcı kontrolü, bilimsel araştırma ve uzmanlık gerektiren işler için kullanılabilecek bir model olarak sunuldu. Model önce sınırlı sayıda kuruma sağlanacak, ardından ChatGPT Plus, Pro, Business, Enterprise sürümlerine, API'ye, Microsoft(MSFT) Azure'a ve Amazon Web Services(AWS) Bedrock'a genişletilecek. OpenAI'nin GPT-6 Astra API'sini ve ücretli kullanıcılara açılış sürecini ele alan haberinde de kademeli bir dağıtım yönteminin izlendiği aktarılmıştı.
OpenAI'nin resmi değerlendirme tablosuna göre Astra, Terminal-Bench 4.0'da yüzde 57,9, DeepSWE v1.1'de ise yüzde 74,1 puan aldı. Aynı tabloda Fable 5.1'in puanları sırasıyla yüzde 55,8 ve yüzde 67,4 olarak yer aldı.
Buna göre Astra, Terminal-Bench 4.0'da Fable 5.1'den 2,1 puan, DeepSWE v1.1'de ise 6,7 puan daha yüksek performans gösterdi. Ancak değerlendirme ortamının ve uygulama sürecinin tamamen aynı olup olmadığının ayrıca doğrulanması gerekiyor.
Bilgisayar kullanımını ölçen OSWorld 2.0 testinde Astra yüzde 72,6, GPT-5.6 Sol ise yüzde 65,7 puan aldı. OpenAI, Astra'nın bu simülasyonda görev başına GPT-5.6 Sol'dan yaklaşık yüzde 47 daha az sürede daha yüksek puan elde ettiğini açıkladı.
OSWorld 2.0 sonuçları, OpenAI'nin kendi modelleri arasındaki bir karşılaştırmaya dayanıyor. Bu rakamın tek başına açık kaynaklı modellerle aradaki performans farkını gösterdiği şeklinde yorumlanması mümkün değil.
İki şirketin bu yarışta öne çıkardığı nokta, basit soru-cevap yeteneğinden çok bir görevi sonuna kadar yürütebilme becerisi oldu. Her iki model de yalnızca kod üretmekle kalmayıp tarayıcı kontrolü, test yazımı ve hata giderme gibi çok aşamalı görevleri yerine getirecek şekilde tasarlandı.
Bu doğrultuda model karşılaştırma ölçütü de tek bir yanıtın doğruluğundan, kodlama ajanı ve bilgisayar kullanımı değerlendirmelerine doğru genişliyor. Aynı model bile araç çağırma (tool-calling) yöntemine ve çalıştırıldığı ortama göre farklı sonuçlar verebildiğinden, yalnızca benchmark puanlarına bakarak gerçek geliştirme ortamındaki performansı kesin biçimde belirlemek zor.
Kaynak metinde yer alan web geliştirme benchmark'ında 1.800 puanlık fark ve açık ağırlıklı modellerin yaklaşık 4 ay geride kaldığı iddiası, resmi verilerde doğrulanmadı. Intelligence Index'teki 8,5 puanlık fark da tek başına açık kaynak ve açık ağırlıklı ekosistemin tamamı için ortalama bir gecikme süresi hesaplamaya yeterli bir dayanak oluşturmuyor.
Açık ağırlıklı (open-weight) modeller, eğitilmiş ağırlıkları kamuya açık hale getirilen modelleri ifade ediyor; ancak bu kavram, kapsam ve lisanslama açısından açık kaynakla tam olarak aynı anlama gelmiyor. Bu nedenle kapalı modellerle açık ağırlıklı modeller karşılaştırılırken yalnızca performansa değil, fiyata, ağırlıkların açıklanıp açıklanmadığına ve dağıtım koşullarına da bakılması gerekiyor.
Anthropic, Fable 5.1'i uzun süreli kodlama ve ajan tipi görevlere göre uyarlanmış bir model olarak tanımladı. OpenAI da Astra'yı kodlama, bilgisayar kullanımı, bilimsel araştırma ve uzmanlık gerektiren işlerde kullanılabilecek bir model olarak tanıttı.
İki modelin tanıtım tarihleri ve temel özellikleri doğrulanmış olsa da, açık kaynaklı modellerin tamamıyla aynı koşullarda kıyaslanan bir üstünlük sonucu henüz sunulmadı. Gerçek geliştirme ortamındaki performans ve maliyetin değerlendirilebilmesi için aynı çalıştırma ortamı ve değerlendirme sürecinin uygulandığı ek doğrulamalara ihtiyaç var.
OpenAI ile Anthropic'in, sırasıyla sınırlı kurumlara erişim sağlama ve genel kullanıcılar ile API'ye açılma yoluyla model erişim kapsamlarını genişletmeyi planladığı belirtildi.
Yorum 0