Kimi'nin attention çekirdeğinin yapay zekâ tarafından NVIDIA GPU'larına göre yeniden yazılması, resmî uygulamaya kıyasla yaklaşık 3 kat daha yüksek çıkarım hızı sağladı.
BlockBeats'in aktardığına göre yapay zekâ, Kimi'nin attention hesaplamalarında kullanılan GPU çekirdeğini optimize etti. Yeniden yazılan uygulama, resmî sürümden yaklaşık 3 kat daha hızlı çalıştı. Çekirdek, yapay zekâ modellerindeki attention hesaplamalarını GPU üzerinde yürüten düşük seviyeli koddan oluşuyor.
Moonshot AI, Kimi Delta Attention için FlashKDA'yı NVIDIA'nın CUTLASS altyapısını temel alarak yayımladı. vLLM ise Kimi K3'e birleştirilmiş CUDA çekirdeği ile NVIDIA iş birliğiyle geliştirilen çekirdeği uyguladığını açıkladı.
Yorum 0