Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Qwen 3.8 Flash’ta 100 bin token bağlamda çıktı hızı yaklaşık yüzde 30 düştü

Etkinlik sahnesinde oturan Vitalik Buterin / TokenPost.Ai

Vitalik Buterin, yerel yapay zekâ modelinin bağlam uzunluğu 100 bin tokenı aştığında çıktı hızının saniyede 18-21 tokene gerilediğini açıkladı. Kısa bağlamda ise saniyede 28-33 token ölçüldü.

Buterin, AMD Strix Halo platformlu bir dizüstü bilgisayarda Qwen 3.8 Flash modelini açık kaynaklı llama.cpp çıkarım çerçevesiyle çalıştırdı. Chainnews (ABMedia), Buterin’in 10 testten oluşan performans tablosunu yayımladığını bildirdi.

Tabloda mevcut istem uzunluğu, yeni girilen istem uzunluğu, üretilen token sayısı, girdi işleme hızı ve çıktı hızı yer aldı. Testler, mevcut bağlam uzunluğuna göre kısa ve uzun bağlam olmak üzere iki gruba ayrıldı.

Mevcut bağlamın 2.136-7.799 token olduğu altı testte çıktı hızı saniyede 28,07-33,37 token arasında ölçüldü. En yüksek değer saniyede 33,37 token, en düşük değer ise saniyede 28,07 token oldu.

Mevcut bağlamın 104.535-107.402 token olduğu dört testte çıktı hızı saniyede 18,42-20,78 token olarak ölçüldü. Kısa bağlamla karşılaştırıldığında çıktı hızı yaklaşık yüzde 30-40 daha düşük kaldı.

Girdi işleme hızında da bağlam uzunluğuna bağlı fark görüldü. Kısa bağlam grubunda bir test dışında hız saniyede 300-373 token olurken, uzun bağlam grubunda saniyede 150-198 tokene geriledi.

Kısa bağlam grubundaki istisnai girdi işleme hızı saniyede 109,82 token oldu. Bu testte mevcut istem 2.136 token, yeni girilen istem ise 110 token uzunluğundaydı.

Token, yapay zekâ modelinin cümleleri işleyip üretirken kullandığı temel birimdir. Bağlam uzunluğu, modelin tek seferde başvurduğu girdi bilgilerinin kapsamını ifade eder. Bağlam uzadıkça modelin işlemesi gereken bilgi miktarı da artar.

Sonuçlar, aynı dizüstü bilgisayarda bağlam uzunluğuna bağlı performans değişimini karşılaştırıyor. Modelin kuantizasyon hassasiyeti, bellek yapılandırması, Strix Halo’nun ayrıntılı özellikleri ve güç ayarları açıklanmadı.

Bu nedenle söz konusu değerleri farklı bilgisayarlarda yapılan ölçümlerle doğrudan karşılaştırmak zor. Donanım ve çalıştırma ayarları değiştiğinde aynı modelin girdi ve çıktı hızları da farklılaşabilir.

Buterin, llama.cpp’nin ilgili modeli işleme verimliliğinin hızla iyileştiğini söyledi. Yerel modellerin “işlerin çoğunu doğrudan halledebilecek noktaya yaklaştığını” değerlendirdi.

Vitalik Buterin (Vitalik Buterin) Ethereum ortak kurucusu, yerel modellerin gizliliği korumaya yönelik bir ara katman olarak kullanılabileceğini de belirtti. Buterin, “yerel modelin daha güçlü modellere yöneltilen sorguları düzenleyerek kişisel bilgiler içeren soruların sızmasını önlediği” iş akışlarının mümkün hale gelmeye başladığını söyledi.

Bu yöntemde yerel model, kullanıcının sorusunu önce işler ve bulut modeline gönderilecek içerikle cihazda tutulacak bilgileri ayırır. Hassas bilgiler içeren taleplerin doğrudan dış sunuculara gönderilmemesi temel avantaj olarak öne çıkıyor.

Vitalik Buterin daha önce gizlilik teknolojilerinin yaygınlaşması için uygulama maliyeti ve kullanım kolaylığının önemli olduğunu söylemişti. Bu sonuçlar, belirli bir dizüstü bilgisayarda bağlam uzunluğuna bağlı yerel model işlem hızı farkını gösteriyor.

Bununla birlikte sonuçlar belirli bir dizüstü bilgisayar ve çalıştırma ortamında elde edildi. Yerel yapay zekâ modellerinin gerçek kullanım potansiyelini değerlendirmek için model ayarları, bellek yapılandırması ve güç koşullarının birlikte açıklandığı ek testlere ihtiyaç var.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1