Alibaba'nın (BABA) geliştirdiği açık ağırlıklı (open-weight) Qwen ailesinden 27 milyar parametrelik bir model, Meta'nın (META) Muse Glimmer(Muse Glimmer) modeliyle karşılaştırıldığı sekiz benchmark testinin tamamında öne geçti. Yerel çalışan yapay zeka modelleri arasındaki rekabet artık kodlama ve ajan (agent) görevlerindeki performans üzerinden ölçülüyor.
BlockBeats(BlockBeats), Dongcha Beating(动察 Beating) takibini kaynak göstererek Qwen3.8-27B modelinin, Meta'nın 30 milyar parametrelik Muse Glimmer modelini sekiz resmi benchmark karşılaştırmasının tamamında geride bıraktığını aktardı. Ancak Qwen'in resmi blogunda ve Hugging Face(Hugging Face) model kartında yer alan kamuya açık 27B modelin adı Qwen3.6-27B olarak görünüyor. Bu model, görsel kodlayıcı (vision encoder) içeren 27 milyar parametrelik bir dil modeli ve Hugging Face'de Apache 2.0 lisansıyla kayıtlı.
BlockBeats'in paylaştığı karşılaştırmaya göre Qwen'in 27B sınıfı modeli, Terminal-Bench 2.1 testinde 73,0 puan aldı; Muse Glimmer aynı testte 51,7 puanda kaldı. SWE-bench Pro'da skorlar 61,7'ye 51,2, OSWorld-Verified'da ise 84,3'e 65,9 olarak açıklandı. Bu üç test sırasıyla terminal tabanlı görevleri, yazılım mühendisliği problemlerini ve bilgisayar kullanan ajanların performansını ölçüyor.
Karşılaştırmada Anthropic'in(Anthropic) Claude Opus 4.6(Claude Opus 4.6) modeliyle yapılan kıyaslamaya da yer verildi. BlockBeats'e göre her iki modelin de puanının bulunduğu 19 testten 15'inde Qwen'in 27B sınıfı modeli önde çıktı. SWE-bench Pro, LiveCodeBench, OSWorld, AndroidWorld ve bazı görsel görevlerde Qwen üstünlük sağlarken; Terminal-Bench, GPQA, HLE ve NL2Repo testlerinde geride kaldığı belirtildi.
Resmi Qwen3.6-27B model kartında ise farklı ölçütlerle elde edilmiş rakamlar yer alıyor. Qwen, model kartında SWE-bench Verified skorunu 77,2, SWE-bench Pro skorunu 53,5 ve Terminal-Bench 2.0 skorunu 59,3 olarak paylaştı. Değerlendirme ortamı ('harness') ve test sürümü değiştiğinde puanlar da değişebiliyor; bu yüzden farklı benchmark tablolarını aynı ölçütmüş gibi karşılaştırmak 'yanıltıcı' olabilir.
Meta'nın Muse Glimmer modeli daha önce Mac ve PC'de çalışabilen açık kaynaklı (open-source) bir ajan modeli olarak duyurulmuştu. O haberde ajan modellerinin, kullanıcı talimatlarına göre görev planı oluşturup çok adımlı işlemleri yürütebilen yapay zeka sistemleri olduğu aktarılmıştı. Ardından açık ağırlıklı (open-weight) ile açık kaynaklı (open-source) modeller arasındaki fark da ele alınmıştı.
Bu karşılaştırmanın asıl önemi, sıralamanın kendisinden çok yerel yapay zeka performansının ölçütünün değişmesinde yatıyor. Daha önce hafif modellerde maliyet ve dağıtım kolaylığı ön plana çıkarken, son karşılaştırmalar artık kod deposu düzenleme, terminal işlemleri ve ekran kontrolü gibi gerçek geliştirici ortamındaki becerilere odaklanıyor.
Kripto para piyasasıyla doğrudan bağlantı şimdilik sınırlı. Yerel yapay zeka modelleri ve açık ağırlıklı model rekabeti, merkeziyetsiz bilişim, yapay zeka doğrulama ve geliştirici araçları alanlarıyla kesişebilir. Ancak bu benchmark karşılaştırmasının ilgili token fiyatlarına ya da işlem hacimlerine doğrudan bir etkisi şu an için 'teyit edilmiş değil'.
Doğrulama kaynakları: Qwen resmi blogu, Qwen3.6-27B Hugging Face model kartı, Meta AI geliştirici sayfası.
Yorum 0