DDN, depolama platformu Infinia'yı Nvidia'nın ($NVDA) çıkarım (inference) veri aktarım sistemine entegre etti. İş birliğinin odağında, büyük dil modeli (LLM) hizmetlerinde GPU'ların veri beklerken harcadığı süreyi azaltmak yer alıyor.
DDN, 23 Temmuz'da yayınladığı teknik blog yazısında Infinia NIXL eklentisinin Nvidia'nın NIXL 1.3 dağıtımına ve Dynamo çıkarım konteynerine dahil edildiğini açıkladı. NIXL, "NVIDIA Inference Transfer Library" ifadesinin kısaltması olup, dağıtık çıkarım ortamlarında GPU, CPU, SSD ve nesne depolama arasındaki veri hareketini yöneten bir kütüphane.
Bu entegrasyon, yapay zeka çıkarım sürecinde ortaya çıkan "KV önbelleği" aktarımına odaklanıyor. KV önbelleği, LLM'lerin önceki bağlamı yeniden kullanabilmesi için sakladığı ara verilerdir. Konuşma uzadıkça veya aynı anda çok sayıda istek geldiğinde KV önbelleği GPU belleğini hızla zorluyor. Nvidia'nın Dynamo dokümantasyonu, KV önbelleğinin GPU belleği, CPU belleği, SSD ve ağa bağlı depolama arasında taşınmasının yeniden hesaplamayı azaltarak yanıt gecikmesini düşürebileceğini belirtiyor.
Daha önce depolama eklentisinin ayrı olarak temin edilmesi, kurulu NIXL sürümüyle uyumluluğunun doğrulanması ve her ortam için ayrı ayrı sürdürülmesi gerekiyordu. NIXL 1.3 ile birlikte Infinia eklentisi standart pakete dahil edildiği için, NIXL kurulduktan veya Dynamo konteyneri kullanıldıktan sonra yalnızca DDN istemci paketinin eklenmesi yeterli oluyor. DDN, uygulama kodunda değişiklik yapmadan yalnızca yapılandırma üzerinden KV önbelleği hızlandırma özelliğinin etkinleştirilebildiğini açıkladı.
Sven Oehme (Sven Oehme), DDN Baş Teknoloji Sorumlusu (CTO), teknik blog yazısında "DDN Infinia now feeds context to the GPUs directly" dedi. Bu ifadeyle, Infinia'nın bağlam verisini doğrudan GPU'lara ileterek GPU'ların token üretimine daha fazla işlem gücü ayırmasını sağladığı anlatılıyor. Ancak gerçek maliyet tasarrufu oranı, müşteri ortamına ve iş yüküne göre değişebiliyor.
GitHub'daki ai-dynamo/nixl deposu, NIXL'i Nvidia Dynamo gibi yapay zeka çıkarım çerçevelerinde uçtan uca iletişimi hızlandıran bir kütüphane olarak tanımlıyor. CPU ve GPU belleğini, dosya, blok ve nesne depolamayı eklenti yapısıyla soyutlayarak farklı depolama katmanları arasındaki veri hareketini yönetiyor.
Bu iş birliği, TokenPost'un daha önce aktardığı yapay zeka veri merkezlerindeki depolama ve aktarım darboğazına yönelik çözüm arayışıyla örtüşüyor. Micron ve Microchip depolama cihazları ile bağlantı yapılarının işlem performansını artırmaya odaklanırken, DDN ve Nvidia çıkarım sürecinde saklanan bağlam verisinin GPU'ya taşınma yolunu iyileştiriyor.
Bu açıklamada kripto para ve blok zinciriyle doğrudan bir bağlantı teyit edilmedi. Yapay zeka işlem gücü kullanan kripto altyapı şirketleri için GPU kullanım oranı ve veri merkezi maliyetleri dolaylı bir işletme faktörü olabilir; ancak somut bir etki ortaya konmadı.
Yorum 0