Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

3.000 token/saniye: Kog, GPU'larda hız iddiasını duyurdu

Test düzeneği üzerinde GPU hızlandırıcı kartı ve soğutma sistemi / TokenPost.ai

Fransız girişim Kog, standart veri merkezi GPU'larında yapay zeka çıkarım (inference) hızını artırma stratejisiyle dikkat çekiyor. Şirket, özel bir çıkarım çipi geliştirmek yerine yazılım ve model mimarisini birlikte tasarlayarak Nvidia(NVDA) ve AMD(AMD) GPU'larının kullanım verimini yükseltmeyi hedefliyor.

TechCrunch'ın haberine göre Kog, GPU'ların ajan tipi (agentic) iş akışlarındaki çıkarım için uygun olmadığı yönündeki yaygın görüşü bir yanılgı olarak görüyor. Kog'un kurucusu ve CEO'su Gaël Delalleau(Gaël Delalleau), aynı haberde “GPU'nun önünde parlak bir gelecek var” dedi. Delalleau'ya göre mevcut GPU'lar çıkarım pazarında çok daha uzun ve derin biçimde kullanılabilir.

Kog'un odaklandığı nokta, tek bir kullanıcı isteğine verilen yanıt hızı. Yapay zeka ajanları planlama, kod yazma, test etme ve düzeltme gibi adımları sırayla tekrarlıyor. Bir adımın çıktısı gecikirse sonraki adım da gecikiyor; bu yüzden tek isteğin gecikme süresi tüm işin hızını belirliyor.

Şirket, bu darboğazı azaltmak için çalışma zamanını (runtime), GPU çekirdeğini ve model mimarisini tek bir gecikme odaklı işlem hattında birleştirdiğini açıklıyor. Yapay zeka altyapısı rekabeti genellikle daha büyük modellere ve daha fazla hızlandırıcıya odaklanırken, Kog zaten kurulu veri merkezi GPU'larından kalan performansı çıkarmaya ağırlık veriyor.

Kog, 28 Mayıs'ta (yerel saatle) tanıttığı Kog Inference Engine teknik ön izlemesinde, 8 adet AMD Instinct MI300X GPU ile istek başına saniyede 3.000 çıktı token'ı elde edildiğini duyurdu. Aynı koşullarda 8 adet Nvidia H200 GPU'da bu rakam istek başına saniyede 2.100 çıktı token'ı olarak açıklandı. Testler FP16 hassasiyetinde, 1 parti (batch) boyutunda ve spekülatif kod çözme (speculative decoding) kullanılmadan yapıldı.

Bu rakamlar Kog'un kendi blog yazısı ve demoları üzerinden paylaşıldı. Şirketin web sitesi de ürünü istek başına saniyede 3.000 token ve 30 kat daha hızlı çıkarım olarak tanıtıyor; yapay zeka destekli kodlama ajanlarını ve ajan tipi iş akışlarını başlıca kullanım alanı olarak gösteriyor.

Kog, 24 Haziran'da (yerel saatle) Hugging Face üzerinde Laneformer 2B modelini de yayımladı. Hugging Face sayfasındaki açıklamaya göre model, 2,3 milyar parametreli, talimatlarla ince ayarlanmış bir kodlama modeli; HumanEval+ testinde yüzde 45,1, MBPP+ testinde yüzde 51,6 skor aldığı belirtiliyor. TechCrunch'ın haberinde parametre sayısı yaklaşık 2 milyar olarak geçiyor; rakamlar arasında küçük bir fark var, ama her iki kaynak da modelin küçük ölçekli bir kodlama modeli olduğu konusunda hemfikir.

AMD'nin resmi AI DevDay 2026 sayfası da Kog'un teknik sunumuna yer verdi. Sayfada Kog'un oturumu, AMD Instinct GPU'larında istek başına saniyede 2.500 token üretmeyi hedefleyen gerçek zamanlı bir çıkarım yığını olarak tanımlandı. Kog'un Ağustos'ta paylaştığı LinkedIn gönderisinde ise şirketin canlı bir demoda saniyede 2.857 token kaydettiği belirtildi.

Tartışmanın odağında hız rakamlarının nasıl yorumlanacağı var. LinkedIn'deki yorumlarda olumlu tepkilerin yanı sıra karşılaştırma koşullarının aynı olup olmadığını soran mesajlar da yer aldı. Başka bir yorumda ise Cerebras'ın daha büyük modellerde benzer hızlara ulaştığı belirtildi. Aynı saniyedeki token sayısı olsa bile model büyüklüğü, donanım, parti boyutu, hassasiyet ve kod çözme yöntemi farklıysa doğrudan karşılaştırma yapmak güçleşiyor.

Çıkarım, eğitilmiş bir yapay zeka modelinin soruları yanıtlaması veya kod üretmesi sürecini ifade ediyor. Token ise modelin metni işlerken kullandığı temel birim. Bir kullanıcının tek isteğine karşılık modelin saniyede kaç çıktı token'ı ürettiği; sohbet botları, kodlama araçları ve ajan tipi otomasyon hizmetlerinin hissedilen hızını doğrudan etkiliyor.

Piyasanın yapısı gereği çıkarım rekabeti yalnızca çip performansıyla sınırlı kalmıyor. GPU tedariki, veri taşıma, çekirdek optimizasyonu, model mimarisi ve parti işleme yöntemi bir arada rol oynuyor. Kog'un yazılım ve modeli birlikte tasarlamaya bu kadar vurgu yapmasının nedeni de bu.

Konu, ajan tipi yapay zeka hizmetlerinin ihtiyaç duyduğu çıkarım altyapısı rekabetinin bir görünümü olarak öne çıkıyor. TokenPost daha önce de GPU'ların veri bekleme süresini kısaltan çıkarım altyapısı rekabetini ele almıştı.

Ancak Kog ile herhangi bir blockchain projesi arasında doğrudan bir bağlantı bulunmuyor. Bu haberin odağı token ihracı veya blockchain entegrasyonu değil; ajan tipi yapay zeka hizmetlerinin gerektirdiği düşük gecikme süresinin mevcut GPU altyapısında nasıl sağlanacağı.

Kog'un önündeki görev, kendi demolarının ötesine geçip aynı yaklaşımın daha büyük modellerde ve gerçek üretim ortamlarında da işlediğini göstermek. CEO Delalleau, TechCrunch'a Eylül'e kadar ilk büyük modeli 10 kat hıza taşırlarsa müşteri ilgisi ve seri A görüşmelerine başlayabileceklerini söyledi. Bu henüz planlama aşamasında.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1