OpenAI'nin GPT-6 Sol (Max) modeli, Agent Arena'da %7,68 net iyileşme oranıyla 6. sırada yer aldı. API fiyatları, GPT-5.6 Sol'un promosyon fiyatına kıyasla giriş ve çıkış işlemlerinde ayrı ayrı %50 düştü.
OpenAI, GPT-6 Sol ve GPT-6 Luna modellerini 22'sinde tanıttı. GPT-6 Sol'un API fiyatı 1 milyon token başına giriş için 2 dolar (yaklaşık 2.738 won), çıkış için 10 dolar (yaklaşık 13.690 won) olarak belirlendi. Daha önce açıklanan GPT-6 Sol ve Luna API fiyatlarıyla karşılaştırıldığında maliyet, GPT-5.6 Sol'un promosyon fiyatının yarısına indi.
Agent Arena'nın resmi sıralamasında GPT-6 Sol (Max) %7,68 net iyileşme oranıyla 6., GPT-5.6 Sol (xHigh) ise %6,16 oranıyla 8. sırada bulunuyor.
Agent Arena'nın net iyileşme oranı tek bir test puanını ifade etmiyor. Bu oran, gerçek ajan oturumlarında görevin başarıyla tamamlanıp tamamlanmadığı, kullanıcının olumlu veya olumsuz tepkisi, düzeltme talimatlarının yerine getirilmesi, komut hatalarının düzeltilmesi ve var olmayan araçların çağrılıp çağrılmadığı gibi ölçütler bir arada değerlendirilerek hesaplanıyor.
Değerlendirme sürecinde modelin kendi etkisiyle araç ve harici çalışma düzeninin etkisini ayırmak için rastgele atama ve nedensel izleme yöntemlerinden yararlanılıyor. Bu nedenle net iyileşme oranı, standart bir kodlama benchmark puanı veya modelin mutlak doğruluk oranı anlamına gelmiyor.
Agent Arena'da GPT-6 Sol için oturum başına gösterilen medyan maliyet 0,74 dolar oldu. GPT-5.6 Sol'da bu rakam 0,91 dolar olarak kaydedildi. Böylece iki modelin gerçek oturum maliyetleri arasında da fark görüldü.
GPT-6 Sol, AutomationBench 1.0.6'da xhigh ayarında %33,2 puan ve görev başına 0,27 dolar maliyet kaydetti. Bu sonuç, model performansının yanı sıra bir görevi tamamlamanın maliyetini de ortaya koyuyor.
GPT-6 Sol, DeepSWE v1.1'de %68,8 puan aldı. Bu sonuç, Claude Fable 5'in %69,9'luk en yüksek puanına yaklaştı. OpenAI, görev başına maliyetin yaklaşık %80 daha düşük olduğunu açıkladı.
Ancak bu karşılaştırmalarda modellerin ayarları ve değerlendirme ortamlarının aynı olduğunu söylemek zor. Aynı modelde bile akıl yürütme seviyesi, araç yapılandırması ve görev türüne bağlı olarak başarı oranı ile maliyet değişebilir.
OpenAI, GPT-6 Sol'un öne çıkan yönü olarak en yüksek performanstan çok tekrarlanan görevlerdeki maliyet verimliliğini vurguladı. İş otomasyonu gibi aynı tür görevlerin defalarca yürütüldüğü ortamlarda token fiyatının yanı sıra görev başına maliyet de önemli bir ölçüt olabilir.
Nominal API fiyatı ile gerçek oturum maliyeti farklılaşabilir. Ajanın kaç kez araç çağırdığı, görev başarısız olduktan sonra yeniden deneyip denemediği ve görüşmenin ne kadar uzadığı nihai maliyeti etkiler.
OpenAI, iş otomasyonu değerlendirmesinde GPT-6 Sol'un Claude Opus 5'ten daha yüksek puan aldığını ve görev başına maliyetin bunun %9'u seviyesinde kaldığını açıkladı. Bu rakam da belirli bir değerlendirme ortamından elde edildiği için tüm görevlerde geçerli bir maliyet avantajı anlamına gelmiyor.
Kullanıcı tepkileri farklılık gösterdi. Bazı kullanıcılar azalan kullanım miktarını ve maliyeti olumlu değerlendirirken, Reddit'teki bazı kullanıcılar belirli kodlama görevlerinde GPT-6 Sol'un GPT-5.6 Sol'dan daha yavaş olduğunu veya daha zayıf sonuç verdiğini iddia etti.
Reddit kullanıcılarının değerlendirmeleri bireysel kullanım deneyimlerine dayanıyor. Genel performansı değerlendirmek için Agent Arena'nın net iyileşme oranı ve bireysel benchmark puanlarının yanı sıra iş bazındaki başarı oranı, araç çağrısı sayısı ve yeniden deneme maliyeti de incelenmeli.
GPT-6 Sol'un açıklanan fiyatı ve Agent Arena sıralaması doğrulandı. Ancak metinde geçen 4.000'den fazla gerçek ajan oturumuna ilişkin veri, OpenAI veya Agent Arena'nın kamuya açık belgelerinde ayrıca doğrulanamadı. GPT-6 Sol'un değerlendirme sonuçları maliyet ve performansı birlikte karşılaştırmak için bir çerçeve sunarken gerçek maliyet kullanım ortamına göre değişebilir.
Yorum 0