Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

12,4 milyar parametreli Ling-3.0-flash, token başına sadece 510 milyon kullanıyor

Veri merkezi sunucu rafının yanındaki yapay zeka çıkarım kartı / TokenPost.ai

Ant Group'un yapay zeka birimi inclusionAI, toplam 12,4 milyar parametreye sahip olan ancak token başına yalnızca 510 milyon parametreyi etkinleştiren büyük dil modeli Ling-3.0-flash'ı tanıttı. FP8 kuantizasyon sürümünün boyutunun, BF16 sürümünün yaklaşık yarısı kadar, yani yaklaşık 128GB olduğu bildirildi.

Çinli BlockBeats'in 5'inde aktardığına göre, Ling-3.0-flash'ın hem orijinal BF16 sürümü hem de FP8 kuantizasyon sürümü MIT lisansıyla Hugging Face ve ModelScope'a yüklendi ve geliştiriciler bu modelleri SGLang veya vLLM ile kendi sistemlerinde çalıştırabiliyor. BlockBeats'in verdiği rakamlara göre BF16 sürümünün boyutu yaklaşık 255GB, FP8 sürümünün boyutu ise yaklaşık 128GB.

Ant Ling'in resmi belgeleri Ling-3.0-flash'ı bir "Uzman Karışımı" (Mixture-of-Experts, MoE) modeli olarak tanımlıyor. Uzman karışımı yapı, girdiye bağlı olarak yalnızca belirli uzman ağlarını devreye sokan bir mimari olup, toplam model boyutunu korurken gerçek işlem yükünü azaltıyor.

Resmi belgelere göre model, varsayılan olarak 256K bağlam penceresini destekliyor ve bu pencere 1M token'a kadar genişletilebiliyor. Yüksek frekanslı görevlerde, modelin saniyede en fazla 1.000 token'lık zirve çıkarım hızını ve 100 milisaniyenin altında ilk token yanıt süresini (TTFT) hedeflediği belirtildi.

Ant Group, 27 Temmuz'daki resmi basın açıklamasında Ling-3.0-flash'a KDA (Kimi Delta Attention) ve MLA (Multi-head Latent Attention) katmanlarının 5'e 1 oranında iç içe yerleştirildiği yerel hibrit doğrusal dikkat (native hybrid linear attention) mimarisinin uygulandığını açıkladı. Önceki nesle kıyasla uzman etkinleştirme oranı da 32'de 1'den 64'te 1'e düşürüldü.

FP8, parametreleri BF16'dan daha düşük hassasiyetle depolayarak ağırlık boyutunu ve bellek kullanımını azaltan bir format. BlockBeats'in verdiği rakamlara göre FP8 sürümünün boyutu, BF16 sürümünden yaklaşık yarı yarıya daha küçük. Ancak 5 itibarıyla Ant Ling'in resmi model belgelerinde toplam ve etkin parametre sayıları ile bağlam penceresi görüntülenebilirken, aynı Hugging Face model kartında görüntülenebilen bilgiler sınırlı kaldı.

Ant Ling'in resmi fiyatlandırma belgesine göre Ling-3.0-flash, Kore saatiyle 23 Temmuz saat 01:00'den 7 Ağustos saat 00:59:59'a kadar ücretsiz olarak sunuluyor. Ağustos ayında yüzde 75 indirim uygulanacak; normal fiyat ise 1 milyon giriş token'ı başına 0,40 yuan, 1 milyon çıkış token'ı başına 1,20 yuan olarak belirlendi.

Bu açıklamada kripto para veya blokzincirle doğrudan bir bağlantı sunulmadı. Kendi sunucularında veya özel bulut ortamlarında ajan tipi (agentic) yapay zeka çalıştırmayı planlayan geliştirici ekiplerin, gerçek dağıtım öncesinde model kartını, lisans dosyalarını ve sağlama (checksum) değerlerini kontrol etmesi gerekiyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1