Büyük dil modellerinin (LLM) metin yerine dahili durumları olan KV-cache'leri doğrudan birbirleriyle paylaştığı yeni bir iletişim teknolojisi tanıtıldı. Tsinghua Üniversitesi araştırmacıları, bu yöntemle modeller arasındaki ortalama iletişim gecikmesinin metin tabanlı yönteme kıyasla 2,5 kat azaldığını açıkladı.
Araştırmacıların önerdiği ‘Cache-to-Cache (C2C)’ yöntemi, bir modelin KV-cache'ini başka bir modelin temsil uzayına dönüştürerek birleştiriyor. Konuyla ilgili makale ilk olarak 3 Ekim 2025'te yayımlandı, 2 Mart 2026'da güncellendi ve Uluslararası Öğrenme Temsilleri Konferansı'nın (ICLR) 2026 makaleleri arasında yer aldı.
Mevcut çoklu LLM sistemlerinde bir model, analiz sonucunu önce metin olarak oluşturuyor, ardından başka bir model bu metni yeniden okuyor. Bu süreçte modelin yüksek boyutlu bilgisi cümlelere sıkıştırılıyor. Ayrıca token'ların sırayla üretilmesi ek gecikmeye yol açıyor.
C2C, bilgiyi sağlayan ‘Sharer’ modelinin KV-cache'ini sinir ağı tabanlı bir ‘Cache Fuser’ aracılığıyla ‘Receiver’ modelinin önbelleğine aktarıyor. Öğrenilebilir geçit mekanizması, bilginin Receiver modelinin hangi katmanlarına iletileceğini seçiyor.
KV-cache, modelin önceki girdileri işlerken biriktirdiği anahtar ve değer biçimindeki dahili durumdan oluşuyor. Bağlam uzadıkça cache büyüyor ve çıkarım hızıyla bellek kullanımını etkileyebiliyor. Bu nedenle uzun metin çıkarımı altyapısının temel unsurlarından biri olarak ele alınıyor.
Araştırmacılar Qwen2.5, Qwen3, Llama3.2 ve Gemma3 dahil olmak üzere çeşitli model aileleri üzerinde deneyler gerçekleştirdi. Model boyutları 0,6B ile 14B arasında değişirken OpenBookQA, MMLU-Redux, ARC-Challenge ve C-Eval gibi kıyaslamalar kullanıldı.
Deneylerde C2C'nin ortalama doğruluğu tek bir modele kıyasla %6,4 ila %14,2 daha yüksek çıktı. Metin tabanlı model iletişimiyle karşılaştırıldığında da doğruluk %3,1 ila %5,4 arttı.
Ortalama gecikme, metin iletişimine göre 2,5 kat azaldı. Araştırmacılar, ara açıklamalar üretmeden modelin dahili temsillerini doğrudan aktaran yapının bilgi kaybını ve sıralı üretimden kaynaklanan gecikmeyi azalttığını belirtti.
Modelin dahili durumu doğrudan aktarılıyor
Makalede KV-cache'in yalnızca hesaplama için kullanılan geçici bir depolama alanı olmadığı, modeller arasında anlam aktarımı sağlayabileceği ifade edildi. Aynı girdiyi işleyen modeller farklı bağlam ve bilgi temsilleri biriktirdiği için bu temsillerin birleştirilmesinin, tek bir modelin gözden kaçırdığı bilgileri tamamlayabileceği aktarıldı.
Bununla birlikte performans artışı her durumda garanti edilmiyor. Araştırmacılar, Sharer modelinin yanlış bilgi aktarması halinde Receiver modelinin tek başına doğru yanıt verebileceği bir soruyu yanlış yanıtlayabileceğini belirtti. Bu tür başarısızlıkların, güçlü bir Receiver ile zayıf bir Sharer eşleştirildiğinde daha sık görülebileceği analiz edildi.
Ölçeklenebilirlik de çözülmesi gereken bir konu olarak kaldı. C2C şu anda model çiftlerine göre projektör ve füzer eğitilen pairwise yapı üzerine kuruluyor. Birden fazla modelin aynı anda iletişim kurabilmesi için ortak bir gizli uzay kullanılması gerekiyor.
Çok sayıda modele yönelik birleşik gizli uzay yaklaşımı önerildi ancak makalede bu yöntem ilk deney aşamasındaki bir yaklaşım olarak tanımlandı. Model kombinasyonları arttıkça füzer eğitim maliyetinin ve iletişim sırasında ortaya çıkan hataların birlikte yönetilmesi gerekecek.
Deney sonuçları tek bir NVIDIA A100 GPU, sınırlı yanıt uzunluğu ve araştırmacıların belirlediği model kombinasyonlarıyla elde edildi. Bu nedenle yöntemin gerçek hizmet ortamlarındaki maliyet, işlem hacmi, güvenlik ve hata yayılımı açısından genellenebilmesi için ek doğrulama gerekiyor.
Resmi kod, Apache-2.0 lisansıyla GitHub deposunda yayımlandı. Depoda bazı model kombinasyonlarında kullanılabilecek önceden eğitilmiş füzer ile eğitim ve değerlendirme örnekleri yer alıyor. Ancak C2C, tüm model kombinasyonlarına hemen uygulanabilen genel amaçlı bir iletişim standardı olarak sunulmadı.
Çalışma, Çinli araştırmacıların AI modelleri arasındaki iletişim yapısını değiştirmeye yönelik bir yöntem ortaya koyması bakımından önem taşıyor. Bununla birlikte, doğrulanan araştırma kapsamında ticari hizmetlere geçiş ya da kripto para, blokzincir ve yarı iletken sektörleriyle doğrudan bir bağlantı sunulmadı.
Yorum 0