Yapay zeka destekli kodlama aracı Cursor'ın, uzman karışımı (Mixture-of-Experts, MoE) modellerin eğitiminde kullandığı yeni teknikle Nvidia(NVDA) GB300 GPU'larından oluşan 512 birimlik bir kümede toplam işlem hacmini yüzde 41 artırdığı öne sürüldü. Teknik, GPU'lar arasındaki veri aktarımı ile hesaplama adımlarını aynı anda yürüterek eğitim sürecindeki darboğazları azaltmayı hedefliyor.
Çin merkezli izleme kanalı Beating, 5'inde Cursor'ın uzman karışımı modellerin eğitimi için 'Mixture-of-Kittens (MoK)' adlı açık kaynaklı bir çekirdek yayımladığını duyurdu. Aynı paylaşımda, tek bir uzman karışımı katmanıyla yapılan testlerde bu çekirdeğin mevcut açık kaynak alternatiflerine kıyasla 2,37 kata varan hız sağladığı iddia edildi.
Uzman karışımı mimarisi, tek bir model içinde birden fazla uzman ağı barındırıp gelen girdiye göre bunlardan yalnızca bir kısmını devreye sokan bir yapı. Bu sayede hesaplama yükü azalırken model boyutu büyütülebiliyor. Ancak uzmanlar birden fazla GPU'ya dağıldığında veri taşıma ve hesaplama bekleme süreleri uzuyor. Haberde yer alan teknik, daha önce ayrı ayrı yürütülen veri aktarımı ve hesaplama adımlarını tek bir çekirdek içinde eş zamanlı çalıştırarak bu bekleme sürelerini kısaltmaya odaklanıyor.
Ancak Cursor'ın resmi blogunda ve herkese açık GitHub deposunda, bu yazının hazırlandığı tarih itibarıyla aynı isimle bir duyuruya rastlanmadı. Yüzde 41 ve 2,37 kat gibi rakamlar Beating'in haberine dayanıyor; gerçek kod, ayrıntılı uygulama ve tekrarlanabilir test sonuçları henüz kamuoyuyla paylaşılmadı.
Cursor, Ağustos 2025'te yayımladığı MXFP8 çekirdek yazısında, Blackwell GPU'lar için uzman karışımı katmanını çekirdek düzeyinde yeniden yazdığını ve bu sayede söz konusu katmanın performansını 3,5 kat, genel eğitim hızını ise 1,5 kat artırdığını açıklamıştı. O dönem uzman karışımı katmanı, ileri yayılım süresinin yüzde 53'ünü, geri yayılım süresinin ise yüzde 27'sini oluşturuyordu.
Şirket, Composer 2 teknik raporunda da Blackwell GPU tabanlı düşük hassasiyetli çekirdekleri, asenkron pekiştirmeli öğrenme hattını ve büyük ölçekli sandbox çalıştırma ortamını eğitim altyapısının temel bileşenleri olarak sunmuştu. warp decode başlıklı teknik yazısında ise uzman karışımı çıkarım yolunun yeniden yapılandırılmasıyla Blackwell üzerinde işlem hacminin 1,84 kat arttığı belirtilmişti.
Bu teknik doğrudan herhangi bir token veya blok zinciri olayıyla ilişkili değil. Yine de yapay zeka ajanları ve kod otomasyonu araçlarını kullanan blok zinciri şirketleri için eğitim altyapısının maliyetini ve performansını belirleyen teknik bir unsur haline gelebilir.
Yarı iletken tarafında ise büyük ölçekli, yüksek performanslı GPU kümeleri kilit rol oynuyor. Nvidia, GB300 NVL72'nin 72 Blackwell Ultra GPU ile 36 Grace CPU'yu tek bir rack ölçekli platformda birleştirdiğini açıklamıştı.
Yorum 0