Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Meta araştırmacıları yapay zekâ ajanlarının puanını %34,8 artırdı; token kullanımı da yükseldi

Dallara ayrılan çalışma yollarını karşılaştıran değerlendirme materyali / TokenPost.ai (macro)

Yapay zekâ ajanlarının çalışma ortamını farklı yönlerden geliştiren bir araştırmada, matematik ve kodlama kıyaslamalarında önceki yönteme göre daha yüksek puanlar elde edildi. Olimpiyat düzeyindeki matematik akıl yürütme doğruluğu %62,0’a ulaşırken, karşılaştırılan Meta-Harness’ın oranı %46,0’da kaldı. Ancak görevleri çözmek için kullanılan token sayısı da arttı.

Meta, Duke University ve University of California, Davis araştırmacıları, 29 Eylül’de arXiv’de “Mixture of Self-Improving Branches for Agent Harness Optimization” başlıklı çalışmayı yayımladı. Makale, hakem değerlendirmesinden geçmemiş bir ön baskı niteliğinde.

Harness, modele sunulacak bilgileri ve kullanılacak araçları belirleyen, sonuçları çalıştırıp doğrulama adımlarını yöneten kod ve ortamı ifade ediyor. Araştırmacılar, model ağırlıklarını yeniden eğitmek yerine harness’i otomatik olarak iyileştirme yöntemini inceledi.

Mevcut Meta-Harness, aday harness’ler oluşturup bunları geliştirme verileri üzerinde çalıştırıyor; sonuçlara ve arama geçmişine dayanarak sonraki adayı öneriyor. Araştırmacılar tek bir arama yolunun sınırlara takılabileceğini değerlendirerek aramayı birden fazla dala ayırdı.

Her dal, farklı geliştirme örnekleri ve iyileştirme yönergeleriyle harness’i düzenliyor. Önceki arama kayıtları sonraki iyileştirme önerilerine de yansıtılıyor. Yeni bir girdi geldiğinde yönlendirici, uygun dalın harness’ini seçerek çalıştırıyor.

Araştırmacılar, harness ile yönlendiricinin seçimi ve ayarlarında yalnızca geliştirme verilerini kullandıklarını, değerlendirme testlerinin sonuçlarından yararlanmadıklarını belirtti. Olimpiyat düzeyindeki matematik akıl yürütme testinde yeni sistem %62,0 doğruluk sağlarken Meta-Harness %46,0’da kaldı. Makalede bildirilen göreli performans artışı %34,8 oldu.

Terminal-Bench 2.0’da göreli artış %11,6, SWE-bench Lite’ta ise %3,8 olarak kaydedildi. Bu sonuçlar, makale yazarlarının belirlediği kıyaslamalar ve deney koşullarıyla sınırlı.

Performans artışı ek hesaplama maliyeti getirdi. Makalenin ekindeki token sayımlarına göre iki dal kullanan sistem, Meta-Harness’a kıyasla matematik deneyinde 1,21 kat, Terminal-Bench 2.0’da 1,71 kat, SWE-bench Lite’ta 1,50 kat daha fazla token kullandı. Bu nedenle yalnızca puan artışına bakarak maliyet verimliliğinin de iyileştiği söylenemez.

Yönlendirici her zaman en güçlü tekil harness’ten daha iyi sonuç vermedi. Makaleye göre matematik akıl yürütmenin başka bir ayarında ve SWE-bench Lite’ta yönlendiricinin sonucu, daha güçlü tek dalın sonucundan birer test vakası daha düşüktü. Araştırmacılar farklı dalların güçlü yanlarını birleştirme olasılığını ortaya koydu; ancak sonuçlar yönlendirmenin her durumda tekil harness’lerden üstün olduğunu göstermiyor.

Araştırmacılar sonuçları sınırlı sayıda model ve kıyaslama ile iki dallı bir ayarda sundu. Tekrarlanan deneylerdeki istikrar ile dal sayısı artırıldığında performans ve maliyetin nasıl değişeceği bu sonuçlardan anlaşılamıyor. Ön baskı niteliğindeki çalışmanın daha geniş koşullarda tekrarlanabilirliği de doğrulanması gereken konular arasında.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1