Çinli Xiaohongshu (RedNote) bünyesindeki yapay zeka laboratuvarı dots.studio, açık kaynaklı 'dots3-note preview' modelini tanıttı. Model, 280 milyar parametreli 'MoE' (Mixture of Experts) mimarisi ve 512 bin token'lık bağlam penceresiyle dikkat çekiyor.
PANews'in 15'inde (yerel saatle) aktardığına göre dots.studio, dots3-note preview'i açık kaynak olarak yayımladı. Modelin gerçek 'aktif' parametre sayısının ise 16 milyar olduğu belirtildi. dots3-note preview yalnızca metin değil, görsel ve ses girdilerini de anlayabiliyor.
dots.studio, uzun soluklu ajan eğitimleri için 'TEMPO' adlı bir pekiştirmeli öğrenme yöntemi geliştirdiğini açıkladı. Model ağırlıkları Hugging Face üzerinden erişime açılırken, API tarafı OpenRouter'a bağlandı.
Performans verileri de paylaşıldı. SemiAnalysis'in yayımladığı grafiğe göre dots3-note, Terminal-Bench 2.1 testinde 75,1 puan aldı. Bu sonuç, aynı grafikte yer alan en yüksek puanlı ABD'li açık ağırlıklı ('open-weight') modelden 4,9 puan daha yüksek.
SemiAnalysis ise günlük kullanım kalitesini ve puanların değerlendirme sistemine göre 'optimize edilmiş' olma ihtimalini netleştirmek için ek testlerin sürdüğünü belirtti. Yani benchmark skorunun gerçek geliştirme ortamındaki performansı birebir yansıtıp yansıtmadığı henüz doğrulanmış değil.
Terminal-Bench ekibi, resmi açıklamasında Terminal-Bench 2.1'i terminal ortamında çalışan ajanları ölçen bir benchmark olarak tanımlıyor. Bu sürüm, önceki 89 görevden 28'inin düzeltildiği bir revizyon niteliğinde; dış bağımlılıklardaki değişiklikler, kaynak koşullarındaki uyumsuzluklar ve görev tanımlarındaki hatalar giderildi.
'MoE' yapısı, çok sayıda uzman modelden yalnızca bir kısmını aktive ederek işlem verimliliğini artıran bir mimari. Büyük modelin tüm parametrelerini kullanmak yerine, göreve özgü kısımları seçerek devreye sokuyor. Geniş bağlam penceresi ise uzun dokümanları, kod tabanlarını ve konuşma geçmişini tek seferde işlemeye yarıyor.
Son dönemde yapay zeka modeli değerlendirmeleri, basit soru-cevap testlerinden gerçek görev performansına doğru kayıyor. TokenPost daha önce, terminal tabanlı görevleri ve yazılım mühendisliği problemlerini çözme becerisini ölçen bir benchmarkın açık kaynak modelleri karşılaştırmada öne çıkan bir gösterge haline geldiğini aktarmıştı.
Bu gelişme, kripto para piyasasından çok yapay zeka geliştirme altyapısıyla ilgili bir konu. Yine de OpenRouter'ın birden fazla yapay zeka modelini tek bir API üzerinden sunması, geliştiriciler ve araştırmacılar için açık ağırlıklı modelleri karşılaştırma imkânını bir adım daha genişletiyor. Gerçek kullanım kalitesi ve tekrarlanan test sonuçları, SemiAnalysis'in süren ek testleriyle daha netleşecek.
Yorum 0