Zhipu AI (智谱), yerli üretim 100 bin çip üzerinde saniyede 200 token’a kadar çıkarım hızı sunan GLM-5.3-FlashX modelini piyasaya sürdü. Şirket, API ve deneme merkezini de kullanıma açtı.
Zhipu AI, GLM-5.3-FlashX’in yerli üretim 100 bin çipin sağladığı çıkarım kapasitesiyle hızlandırıldığını açıkladı. Şirketin altyapı ve çıkarım optimizasyonuna ek yatırım yaptığı bildirildi. PANews haberine göre model, doğrudan hizmet kullanımına sunuldu.
Lansman, yalnızca model performansını değil, gerçek hizmet işletimi için gereken çıkarım altyapısını da öne çıkarıyor. Çıkarım, modelin girdiye dayanarak yanıt üretme sürecini ifade ediyor. İşleme hızı ise model mimarisi, donanım yapısı ve yazılım optimizasyonundan etkileniyor.
GLM-5.3-FlashX’in temel modeli GLM-5.3-Flash, 26 Ağustos’ta tanıtıldı. Modelin toplam parametre sayısı 320 milyar, tek bir çıkarım sürecinde etkinleştirilen parametre sayısı 18 milyar ve bağlam penceresi 1 milyon token olarak açıklandı. Bu özellikler ve duyuru tarihi model belgelerinde de yer alıyor.
Toplam parametre sayısı, modelin sahip olduğu tüm eğitim ağırlıklarının büyüklüğünü gösteriyor. Etkin parametreler ise girdinin işlenmesi sırasında hesaplamaya katılan bölümü ifade ediyor. Bu yapı, modelin genel ölçeğini korurken tek bir istekte gereken işlem miktarını azaltmayı amaçlıyor.
1 milyon token’lık bağlam penceresi, modelin tek bir istekte işleyebileceği girdi ve sohbet geçmişinin kapsamını gösteriyor. Ancak bağlam penceresinin büyüklüğü ile gerçek yanıt hızı farklı göstergeler. Bu nedenle uzun girdiler işlenirken de en yüksek hızın korunacağı söylenemez.
Zhipu AI, GLM-5.3-FlashX için en yüksek çıkarım hızını saniyede 200 token olarak açıkladı. Bu değer şirketin sunduğu azami hız. Genel kullanıcıların deneyimlediği ortalama hız ise istek türüne ve işletim ortamına göre değişebilir.
Şirket, duyuruda ortalama işlem hızını, çip üreticisini, hizmet fiyatlarını veya modeller arası performans karşılaştırmalarını açıklamadı. Bu nedenle saniyede 200 token hızının hangi girdi uzunluğu ve donanım yapılandırmasında ölçüldüğü, ileride paylaşılacak işletim verileriyle netleşecek.
GLM-5.3-Flash, yayımlanmadan önce 'Ox Alpha' adıyla anonim bir teste tabi tutuldu. Modelin resmi adı daha sonra açıklanınca Zhipu AI’ın GLM-5 serisine ait olduğu doğrulandı. FlashX lansmanı da bu model ailesinin API ve deneme hizmetlerinde kullanılmaya başlanması anlamına geliyor.
API, dış hizmetlerin veya geliştiricilerin model işlevlerini çağırmasını sağlayan bağlantı yöntemidir. Deneme merkezi ise kullanıcıların ayrı bir hizmet kurmadan model yanıtlarını test edebileceği bir kanal sunuyor. Her iki özelliğin devreye alınması, modelin yayımlanmasıyla gerçek kullanım ortamının birlikte sunulmasını amaçlıyor.
GLM-5.3-FlashX’in gerçek performansı, ileride paylaşılacak ayrıntılı kıyaslama sonuçları ve API işletim verileriyle karşılaştırılabilecek. Özellikle şirketin açıkladığı azami hızın hangi koşullarda ölçüldüğü ve ortalama işlem hızının açıklanıp açıklanmayacağı takip edilecek.
Yorum 0