Yapay zeka altyapısındaki darboğazın grafik işlemcisi (GPU) işlem gücünden bellek arzına kaydığına dair değerlendirmeler yeniden gündeme geldi. Yapay zeka ajanlarının uzun süreli görevleri yürütebilmesi için önceki bağlamı ve işlem geçmişini kaydedip yeniden çağırması gerekiyor; bu da yüksek bant genişlikli bellek (HBM) ve NAND flash talebindeki baskıyı artırıyor.
Elon Musk(Elon Musk) SpaceX Genel Müdürü, Peter H. Diamandis(Peter H. Diamandis) XPRIZE kurucusunun X'te paylaştığı bir gönderiye "Bunu neredeyse hiç kimse bilmiyor" yanıtını verdi. Diamandis ise paylaşımında yapay zeka ajanları döneminde asıl hız sınırlayıcı unsurun işlem gücü değil bellek olduğunu savundu.
Musk'ın bu tepkisi, yapay zeka bellek talebinin yıllık yüzde 200'ün üzerinde artabileceğine dair önceki değerlendirmenin devamı niteliğinde. Musk, SpaceX'in 2. çeyrek bilanço görüşmesinde bellek üretimindeki yıllık artışın yüzde 20 civarında kalırken talep artışının yıllık yüzde 200'ü aşabileceğini söylemişti.
O dönemki açıklama, yapay zeka veri merkezi yatırım yarışında bellek arzının GPU kadar önemli hale geldiğini gösteriyordu. Yapay zeka modellerinin boyutu ve çıkarım (inference) kullanımı birlikte büyüdükçe, yalnızca işlem birimlerinde değil bağlamı depolayan bellek biriminde de darboğaz büyüyor.
Teknik tartışmanın merkezinde 'KV önbelleği' bulunuyor. Büyük dil modelleri girdi token'larını işlerken bağlam ilişkilerini taşıyan anahtar-değer verisi üretir ve bunu bellekte saklar. Model, önceki bağlamı her seferinde baştan hesaplamak yerine bu veri sayesinde kaldığı yerden devam edebiliyor.
Sohbet botlarında tek bir soru-cevap turu görece kısa sürüyor. Buna karşılık yapay zeka ajanları kodlama, arama ve analiz gibi görevleri çok adımlı biçimde sürdürüyor ve önceki kararlarla işlem geçmişini yeniden çağırması gerekiyor. Bu süreçte saklanması gereken bağlam büyüdükçe, GPU içindeki HBM tek başına yetersiz kalabiliyor.
NVIDIA(NVDA) bu yıl CES'te Inference Context Memory Storage Platform adlı çözümü tanıttı. Şirket, KV önbelleğini GPU HBM'i, sistem belleği, SSD ve paylaşımlı depolama katmanları arasında dağıtmanın, uzun bağlamlı ve ajan tipi çıkarım işlemlerinde saniyedeki token işleme hızını ve enerji verimliliğini mevcut depolama yöntemlerine kıyasla 5 kata kadar artırabileceğini açıkladı.
Bu yapı, yapay zeka çip rekabetinin odağını genişletiyor. Şimdiye kadar GPU'nun işlem gücü ve arz miktarı öne çıkarken, ajan tipi çıkarımda bağlamın nerede saklandığı ve ne hızda çağrıldığı maliyeti ve işlem hacmini belirliyor.
Microsoft(MSFT)'ın Maia 200 yapay zeka çıkarım hızlandırıcısının maliyet verimliliğini öne çıkardığı gelişme de aynı sorunla bağlantılı. Üretken yapay zeka hizmetlerinde tekrarlayan maliyet eğitimden çok çıkarım aşamasında büyüdüğü için işlem hacmi ve enerji verimliliğindeki iyileşme işletme giderlerini doğrudan etkiliyor.
TrendForce, 21 Temmuz'da (yerel saatle) yayımladığı aylık NAND flash raporunda 2026 NAND piyasasının yapay zeka talebi ve sınırlı kapasite artışı nedeniyle arz açığı yaşayacağını belirtti. Şirket, 2026 NAND arz açığı oranını yüzde 4-5 olarak öngördü ve sunucuların toplam NAND bit talebinin yüzde 40'ından fazlasını oluşturduğunu aktardı.
TrendForce, arz kısıtlarının 2027'nin ikinci yarısından itibaren gevşeyebileceğini değerlendirdi. Bu da yapay zeka altyapısındaki büyümenin yalnızca kısa vadeli talebi değil, bellek üreticilerinin kapasite artırma hızını ve uzun vadeli tedarik sözleşmesi koşullarını da etkilediği anlamına geliyor.
Kore piyasasında Samsung Electronics ve SK Hynix'in HBM ve NAND arz stratejileri bu tabloyla doğrudan bağlantılı. SK Hynix, 29 Temmuz'da (yerel saatle) yapılan 2. çeyrek bilanço telekonferansında yapay zeka altyapı yatırımlarının genişlemesi ve sıkı arz koşulları nedeniyle güçlü talebin sürdüğünü açıkladı.
Ancak bellek sektöründeki kâr görünümü yalnızca talep artışıyla belirlenmiyor. Uzun vadeli tedarik sözleşme fiyatları, Çinli üreticilerin kapasite artırımı ve veri merkezi yatırım hızına göre arz açığının şiddeti ve kârlılık değişebiliyor.
Yapay zeka ajanlarının yaygınlaşması, yarı iletken talebinin ağırlık merkezini GPU'dan bellek ve depolama katmanına doğru genişletiyor. Musk'ın bu tepkisi yeni bir rakam ortaya koymaktan çok, yapay zeka altyapı yatırımlarında bellek darboğazının yeniden teyit edildiğinin bir işareti olarak okunuyor.
Yorum 0