Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

CLM-8B, 16,5 milisaniyede karar veriyor: Jev’den 9 kata kadar hızlı

Dizüstü bilgisayar ekranında dinozor oyunu ve klavye / TokenPost.ai

Stanford ve NVIDIA Research tarafından geliştirilen CLM-8B, T-Rex oyun benchmark’ında 16,5 milisaniyede karar vererek Jev’in 149,8 milisaniyelik süresinden 9 kata kadar daha düşük gecikme kaydetti. CLM-8B, metin üretmek yerine aday eylemler arasından seçim yapan yapay zeka ajanları için tasarlanmış bir model.

CLM-8B, 23’ünde yayımlanan ‘Contrastive Language Model’ serisinin ilk açık modeli oldu. Resmi depoya göre CLM-8B, bilgisayar kullanımı, oyun ve araç çağırma görevlerinde Jev’e benzer performans sunarken 9 kata kadar daha düşük gecikme sağladı.

T-Rex benchmark’ında CLM-8B’nin karar süresi 16,5 milisaniye, Jev’in süresi ise 149,8 milisaniye olarak ölçüldü. Ancak bu sonuçlar belirli donanım ve benchmark koşullarında elde edildi. Bu nedenle tüm görevlerde aynı hız farkının görüleceği anlamına gelmiyor.

CLM-8B’nin işlem yöntemi, geleneksel büyük dil modellerinden farklı. Model, mevcut durumu ve aday eylemleri ayrı ayrı vektörlere dönüştürdükten sonra en yakın eylemi seçiyor. Durum ve eylem gömüleri de ayrı hesaplanıyor.

Sık kullanılan eylem gömüleri önbelleğe alınarak işlem süresi kısaltılıyor. Baştan metin üretme ihtiyacı bulunmadığı için yapı, aday eylemlerin hızlı değerlendirilmesi gereken ajan görevlerine uygun.

Model, Qwen3-8B’yi dondurulmuş temel model olarak kullanıyor ve yaklaşık 20 milyon parametre içeren eğitilebilir bir projeksiyon başlığı ekliyor. Eğitimde yaklaşık 60 milyon Nemotron soru-cevap çifti, yaklaşık 30 milyon sentetik hard negative ve yaklaşık 1 milyon ajan yörüngesinden yararlanıldı.

Resmi depo, CLM-8B’nin sıfır atışlı değerlendirmelerde Jev’e benzer sonuçlar verdiğini belirtti. Ayrı bir ince ayarın ardından DeepSWE’de yüzde 81,6, Terminal-Bench 2.1’de ise yüzde 87,6 sonuç elde edildi.

Bu iki sonuç, kamuya açık temel modelin kendisine değil, ince ayarlanmış doğrulayıcı başlığın performansına ait. Bu nedenle temel modelin sıfır atışlı performansıyla ince ayarlı modelin benchmark sonuçlarını aynı ölçütle karşılaştırmak zor.

Jev, uzun metin üretmek yerine verilen duruma dayanarak seçenekler, skorlar, boolean değerler ve olasılıklar döndüren bir model olarak tanıtıldı. Jev’in uzun metin üretimi yerine sonraki eylem seçiminde kullanıldığı örnekte olduğu gibi CLM-8B de üretimden çok karar verme ve seçime odaklanıyor.

CLM-8B genel amaçlı bir sohbet botu değil. Verilen aday eylemlerin skorunu hesaplayıp bunlardan birini seçiyor; adaylar arasında bulunmayan yeni bir yanıt üretmek veya bağımsız cümleler oluşturmak üzere tasarlanmadı.

İki modelin performans karşılaştırması değerlendirme yöntemine göre değişebilir. JevEmbed deposundaki bazı değerlendirmelerde CLM-v0.1-8B, JevBench’in 231 görevinde yüzde 41,99 doğruluk kaydetti. Ancak görev yapısı ve ölçüm yöntemi, geliştirme ekibinin açıkladığı ‘Jev’e benzer performans’ değerlendirmesinden farklı.

Model ağırlıkları ve kod Apache 2.0 lisansıyla yayımlandı. Hugging Face model kartında, Qwen3-8B gömme sunucusu ve çalışma ortamı kurulduğunda modelin tek bir NVIDIA GPU üzerinde yerel olarak çalıştırılabileceği belirtildi.

Açık ağırlıklar ve tek GPU desteği, kendi yapay zeka ajanlarını geliştirmek isteyenlerin modeli doğrudan test etmesine olanak sağlıyor. Ancak bunun gerçek hizmet maliyetlerini düşürüp düşürmeyeceği veya ajan performansını artırıp artırmayacağı ayrıca doğrulanmalı.

Resmi materyallere yönelik topluluk tepkileri farklılaştı. Reddit’teki LocalLLaMA topluluğunda açık ağırlıklar ve düşük gecikme olumlu değerlendirilirken, bazı kullanıcılar genel bilgi ve uzun bağlam işleme alanlarında modelin Jev’e kıyasla daha sınırlı olabileceğini belirtti.

Geliştirme ekibi, çok modlu devam modeli CLM-35B’yi ekim ayının başında yayımlamayı planladığını model kartında açıkladı. Kesin çıkış tarihi ve performans sonuçları henüz paylaşılmadı.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1