Chutes ve Harvard araştırmacıları, büyük dil modellerine (LLM) ait 6 milyar 122 milyon 413 bin 756 isteği içeren açık bir veri seti yayımladı. Gerçek diyaloglar yerine sunum meta verilerini içeren veri seti, üretken yapay zekâ altyapısındaki önbellek ve yönlendirme yapılarını analiz etmeye imkân sağlıyor.
‘A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing’ başlıklı araştırma makalesi, 11 Nisan 2025 ile 12 Nisan 2026 arasında Chutes üzerinde gerçekleşen istekleri inceledi. Verilerde 9.174 model ile anonimleştirilmiş 314 bin 970 kullanıcının istek kayıtları yer aldı.
Açık depoda istek zamanı, model, kullanıcı ve sunum örneği tanımlayıcıları, girdi ve çıktı token sayıları, ilk token üretim süresi (TTFT) ve önbelleğe alınan token sayısı bulunuyor. Veri seti, açık depoda Parquet formatında sunuluyor.
Toplam dosya boyutu yaklaşık 91 GB olurken her satır bir API çağrısını temsil ediyor. Kullanıcı tanımlayıcıları üç ayda bir yeniden anonimleştirildi; istemler ve modellerin gerçek yanıtları yayımlanmadı.
Araştırmacıların dikkat çektiği noktalardan biri, tekrarlanan isteklerin zaman içinde yoğunlaşması oldu. Aynı kullanıcının aynı modele yeniden gönderdiği isteklerin %99’u, önceki isteği izleyen 15 dakika içinde gerçekleşti.
Aynı kullanıcının istekleri kısa aralıklarla devam ettiğinde, önceki girdinin bir bölümünü yeniden kullanan önek önbelleğinin (prefix cache) etkisi artırılabiliyor. Önek önbelleği, daha önce işlenmiş girdileri saklayarak ön işleme hesaplamalarını azaltan ve ilk token üretim süresini düşüren bir teknoloji.
Önbellek verimliliği ile yük dengeleme aynı yönde hareket etmiyor. İlgili istekleri aynı GPU örneğine yönlendirmek önbelleğin yeniden kullanım oranını artırabilir, ancak belirli bir örnekte yoğunluk oluşturabilir. İstekleri birden fazla örneğe dağıtmak yükü dengelerken aynı önbellek durumunun farklı noktalarda tekrarlanmasına yol açabilir.
Araştırmacılar, önbellek farkındalığına sahip yönlendirmenin token isabet oranını artırırken belirli ölçüde yük dengesizliğini kabul etmeyi gerektiren bir yapı sunduğunu belirtti. Yönlendirme, bir isteğin hangi model ve sunum örneğine gönderileceğini belirleme süreci olarak tanımlanıyor ve önbelleğin yeniden kullanımıyla GPU kaynak dağılımının birlikte değerlendirilmesini gerektiriyor.
Veriler, LLM kullanım biçiminin de değiştiğine işaret etti. Veri döneminde girdi uzunluğu genel olarak istikrarlı kalırken çıktı uzunluğunun medyanı birkaç yüz tokendan 100 tokenın altına geriledi.
Araştırmacılar, uzun yanıtların karşılıklı olarak üretildiği sohbet tabanlı kullanım yerine kısa ve tekrarlanan otomatik isteklerin artmış olabileceğini öne sürdü. Bununla birlikte, yalnızca kayıtlar üzerinden her isteğin bir insan mı yoksa yazılım mı tarafından oluşturulduğunun tamamen ayırt edilemeyeceğini açıkladı.
Modellerin kullanım payı da sabit kalmadı. İlk dönemde DeepSeek serisi modeller trafiğe öncülük ederken daha sonra kullanım payı Qwen3-32B ve DeepSeek-V3.2 gibi modellere kaydı. Daha az kullanılan modellerin trafik payı da arttı.
Araştırmacılar, belirli bir dönemdeki gözlemlere dayanarak uzun vadeli GPU kapasitesini veya model talebini tahmin etmenin zor olduğunu vurguladı. Tek bir platformda gözlenen kullanım değişiminin tüm LLM hizmetleri piyasasındaki talep değişimiyle aynı kabul edilemeyeceği belirtildi.
Veri seti, Chutes’un Bittensor’un 64 numaralı subnet’inde faaliyet gösteren merkeziyetsiz bir yapay zekâ çıkarım altyapısı olması açısından da önem taşıyor. Merkeziyetsiz çıkarım platformları istekleri birden fazla örneğe dağıtarak işlerken bu çalışma, gerçek operasyon ortamında biriken istek akışlarını araştırma konusu yaptı.
Bununla birlikte veriler tek bir merkeziyetsiz çıkarım platformundan toplandı. Bu nedenle tüm LLM piyasasını veya Türkiye’deki yapay zekâ hizmeti kullanım biçimlerini temsil etmiyor. Veri setinin yayımlanmasının Bittensor’un TAO fiyatı ya da token talebi üzerindeki doğrudan etkisine ilişkin de bir sonuç sunulmadı.
Çalışmanın kullanım alanı, yapay zekâ modeli operasyonlarının verimliliği ve altyapı tasarımı araştırmalarıyla sınırlı. Temel katkı, önbelleğin yeniden kullanım oranı ile GPU yük dağılımı arasındaki ilişkinin gerçek istek kayıtları üzerinden incelenebilmesi.
Araştırmacılar, istek kalıpları, model kullanımındaki değişimler ve sunum gecikmesini birlikte analiz etmeye imkân veren verileri yayımladı. İstemler ve yanıtlar kapsam dışında bırakıldığı için çalışma, kullanıcı görüşmelerinden çok LLM hizmetlerinin işletilmesine ve altyapı kaynaklarının dağıtımına odaklanıyor.
Sıkça sorulan sorular
Q. Veri setinde gerçek kullanıcı diyalogları yer alıyor mu?
Hayır. İstemler ve model yanıtları dahil edilmedi. Yalnızca istek zamanı, token sayısı, gecikme süresi ve önbellekle ilgili bilgiler gibi sunum meta verileri yayımlandı.
Q. %99 ne anlama geliyor?
Aynı kullanıcının aynı modele tekrarlanan istekleri arasında %99’unun, önceki isteği izleyen 15 dakika içinde gerçekleştiği anlamına geliyor.
Q. Bittensor ile doğrudan bağlantılı mı?
Chutes, Bittensor’un 64 numaralı subnet’inde faaliyet gösteren bir çıkarım platformu. Ancak veri setinin yayımlanmasının TAO fiyatı veya token talebi üzerindeki doğrudan etkisi doğrulanmadı.
Yorum 0