Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Bağlam 4K'dan 128K'ya çıkınca açık modellerin performansı ortalama %62,8 düştü

UUID'lerin ve tablo öğelerinin sıralandığı kıyaslama değerlendirme kâğıdı / TokenPost.ai

Yedi açık ağırlıklı model üzerinde yapılan değerlendirmede, girdi bağlamı 4K'dan 128K'ya çıkarıldığında ortalama performans %62,8 geriledi. Araştırma, uzun bağlamı kabul etme kapasitesinin tek başına çok adımlı görevleri doğru biçimde sürdürme becerisini göstermeye yetmediğine işaret ediyor.

NVIDIA araştırmacıları, “Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability” başlıklı makaleyi 30 Eylül'de yayımladı ve uzun süreli görevleri değerlendirmek için “Long-Transduction” yöntemini önerdi. CryptoBriefing'in aktardığına göre bu kıyaslama; aritmetik hesaplama, UUID sıralama, değişken arama ve tablo dönüştürme gibi modelin girdiye tekrar tekrar başvurup çıktıyı sürdürmesini gerektiren görevleri kapsıyor.

Araştırmacılar bağlam uzunluğunu, girdi veri biçimini ve adım adım görev karmaşıklığını ayrı ayrı değiştirerek performansı ölçtü. Girdi biçimi değiştiğinde ortalama performans %36,5, görev karmaşıklığı artırıldığında ise %39,9 geriledi.

Girdi öğelerinin sabit tanımlayıcıları kaldırıldığında da göreve bağlı performans düşüşleri görüldü. UUID sıralama performansı %64,3, değişken arama performansı %66,4 azaldı. Bu iki oran, makalede belirli görevler ve biçim koşulları altında elde edildi.

Long-Transduction, modelin uzun bir üretim süreci boyunca girdiyi okuma, durumu güncelleme ve çıktıyı sürdürme becerisini incelemek üzere tasarlandı. Araştırmacılara göre bu nedenle kısa soru-cevaplar veya tek görev puanları, birden fazla aşamadan oluşan işlerin güvenilirliğini değerlendirmek için yeterli olmayabilir.

Ölçümler kontrollü bir kıyaslama ortamında yapıldı. Sonuçlar, gerçek şirket işlerinde veya tüm yapay zekâ hizmetlerinde aynı ölçekte performans düşüşü yaşanacağı anlamına gelmiyor.

Araştırmacılar uzun görevlerin küçük parçalara bölünmesini ve girdi öğeleriyle ara çıktılara sabit kimlikler atanmasını önerdi. Karmaşık görevleri tek seferde uzun bir bağlamda birleştirmemek de öneriler arasında yer aldı.

Değerlendirme aritmetik, sıralama, arama ve tablo dönüştürme gibi önceden belirlenmiş görevlerle sınırlıydı. Bu sonuçlardan hareketle gerçek iş sistemlerinin doğruluğu veya uygulamanın etkisi hakkında hüküm vermek mümkün değil.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1