DeepSeek'in V4.1 Flash modeli, web tasarımı değerlendirmesinde 81,2 puan alarak OpenAI'nin GPT-6 Astra modeliyle arasında sadece 1,5 puanlık fark bıraktı. Tasarım başına ortalama maliyet ise 0,023 dolar (yaklaşık 31 won) olarak ölçüldü; bu da Astra'ya kıyasla yaklaşık 70 kat daha düşük bir maliyet anlamına geliyor.
OpenDesign Arena platformu, web uygulaması, kontrol paneli (dashboard), mobil ekran ve açılış sayfası (landing page) üretme becerilerini kapsayan bir testte toplam 13 yapay zeka modelini karşılaştırdı. GPT-6 Astra 82,7 puanla birinci sırada yer alırken, DeepSeek'in V4.1 Flash modeli ikinci oldu.
İki modelin maliyet farkı 1,61 dolar (yaklaşık 2165 won) ile 0,023 dolar (yaklaşık 31 won) şeklinde gerçekleşti. Anthropic'e ait Claude Fable 5.1 modeli 80,3 puan alsa da, iş başına maliyeti 3,66 dolara (yaklaşık 4923 won) kadar çıktı.
İşlem süresinde de V4.1 Flash öne çıktı. Ortalama işlem süresi 5,3 dakika olarak ölçülürken, bu değer Astra'nın 11,1 dakikasından 5,8 dakika daha kısa oldu. Claude Fable 5.1 ise 12,8 dakikada tamamlandı.
V4.1 Flash, bu ayın 10'unda resmi olarak duyuruldu. DeepSeek daha önce V4.1 Flash'i 10 Eylül civarında piyasaya sürmeyi planladığını açıklamıştı.
V4.1 Flash, toplam 552 milyar parametreye sahip bir karma uzman (mixture of experts) modeli. Girdi işleme sırasında yaklaşık 8 milyar, çıktı üretiminde ise yaklaşık 16 milyar parametre devreye giriyor.
Karma uzman modelleri, her seferinde tüm parametreleri değil, göreve özgü gereken kısmı devreye sokuyor. DeepSeek bu yapıyı "asimetrik mimari" olarak tanımladı ve yalnızca gerekli işlemlerin yürütülmesiyle maliyet ile işlem süresinin azaltıldığını belirtti.
OpenDesign Arena'da ek düzenleme yapılmadan doğrudan kullanılabilir bulunan çıktı oranı en yüksek Astra'da görüldü: %60. V4.1 Flash %57,7, Claude Fable 5.1 ise %56,7 ile bu sıralamayı takip etti.
Buna göre V4.1 Flash maliyet ve işlem süresinde öne çıkarken, çıktının anında kullanılabilirliği açısından Astra'nın 2,3 puan gerisinde kaldı. Bu da performans ile verimliliğin her ölçütte aynı sırayı yansıtmadığını gösteriyor.
Bu değerlendirme yalnızca web tasarımı görevleriyle sınırlı kaldı. Web uygulaması, kontrol paneli, mobil ekran ve açılış sayfası üretimi karşılaştırıldığından, aynı modellerin kodlama, mantıksal çıkarım veya bilimsel araştırma gibi farklı görevlerde de benzer performans göstereceği kesin olarak söylenemez.
V4.1 Flash'in maliyet avantajı, büyük ölçekli bir modelin genel bilgi kapasitesini korurken gerçek çıkarım için gereken işlem yükünü azaltan yapısından kaynaklanıyor. Ancak gerçek hizmet maliyeti ve hızı, girdi uzunluğuna, istek biçimine ve sunucu koşullarına göre değişebilir.
TokenPost daha önce, iç testlerde V4.1 Flash'in saniyede 420 token çıktı hızına ulaştığını bildirmişti; ancak o dönemde de karşılaştırma koşullarının tam olarak aynı olmadığı, bu nedenle basit bir kıyaslamanın sınırlı kalacağı belirtilmişti.
Düşük maliyetli modellerin kullanımı yaygınlaştıkça, iş başına maliyet ve işlem süresi model seçiminde belirleyici bir kriter haline gelebilir. Buna karşılık çıktının düzenlenme ihtiyacı, göreve özgü doğruluk ve hizmet kararlılığı gibi unsurların ayrıca doğrulanması gerekiyor.
DeepSeek, V4.1 Flash'i duyururken "daha verimli bir mimari sayesinde daha düşük maliyetle daha fazla kullanıcıya hizmet verebiliyoruz" ifadesini kullandı ve "tasarruf edilen maliyeti kullanıcılara geri yansıtıyoruz" dedi.
Bu sonuçlar, V4.1 Flash'in web tasarımı alanında Astra'ya yakın bir puan elde ederken maliyeti belirgin biçimde düşük tuttuğunu ortaya koyuyor.
Yorum 0