Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Başarı oranı yüzde 96,9'a çıktı: Meta'nın yeni AI ajan yöntemi

Renkli sekmeli araştırma belgeleri ve performans grafiği / TokenPost.ai

Meta($META) yapay zeka ekibi ile Illinois Urbana-Champaign Üniversitesi (UIUC) araştırmacıları, uzun soluklu görevlerde çalışan büyük dil modeli (LLM) ajanlarının yürütme katmanını eğitmek için EvoHarness-RL adlı yöntemi önerdi. Qwen3-8B modelinde ALFWorld testinde ortalama başarı oranı, ReAct yönteminde yüzde 47,9 iken EvoHarness-RL ile yüzde 96,9'a yükseldi.

Araştırmacılar, Kore saatiyle 6 Ağustos sabah 07.29'da arXiv'de yayımladıkları makalede, uzun süreli etkileşim kuran ajanların durum takibi, ilerleme izleme, araç çağırma, sonuç doğrulama ve deneyim yeniden kullanımı için dış yürütme desteğine ihtiyaç duyduğunu belirtti. Hugging Face'in Daily Papers bölümü de makaleyi duyurdu.

Çalışmanın odağı ajana yeni araçlar ya da bellek eklemek değil. Asıl amaç, ajanın dış durumu ne zaman okuyacağını, güncelleyeceğini, geri çağıracağını ve kaydedeceğini öğrenmesini sağlamak.

Araştırmacılar dış durumu üç başlığa ayırdı: 'inanç' (belief), 'ilerleme' (progress) ve 'deneyim' (experience). İnanç, ajanın mevcut ortama dair değerlendirmesini; ilerleme, tamamlanan ve tamamlanmayan görev akışını; deneyim ise önceki görevlerden edinilen ve yeniden kullanılabilen bilgiyi ifade ediyor.

Ajan bu üç duruma göre △track (izle) △commit (kaydet) △recall (hatırla) △note (not al) gibi harness eylemlerinden birini seçiyor. Track durumu okur, commit ilerlemeyi kaydeder, recall geçmiş deneyimi geri çağırır, note ise yeni edinilen bilgiyi kayda geçirir.

Eğitim iki aşamada gerçekleşti. Araştırmacılar önce gözetimli öğrenmeyle modele harness kullanımını öğretti, ardından maliyet duyarlı grup göreli politika optimizasyonu (GRPO) ile modelin dış duruma hangi anda erişmesi gerektiğini ayarladı.

Sayılara bakıldığında fark büyük. Makaledeki tabloya göre Qwen3-8B tabanlı EvoHarness-RL, ALFWorld'ün 'seen' bölümündeki 140 görevde ortalama yüzde 96,9 başarı oranına ulaştı. Aynı koşullarda ReAct yalnızca yüzde 47,9'da kaldı.

Karşılaştırma yapılan SkillOS yüzde 80,2, SkillRL ise yüzde 89,9 başarı oranı gösterdi. Claude Opus 4.5 ise ReAct ile yüzde 96,4, EvoHarness-Base uygulandığında yüzde 98,5 başarı oranına çıktı.

Fark, modelin görmediği ortamlarda da sürdü. Qwen3-8B'nin 'unseen' bölümündeki başarı oranı ReAct'te yüzde 50,0 iken EvoHarness-RL ile yüzde 86,6'ya yükseldi.

Ancak performans artışını yalnızca pekiştirmeli öğrenmenin etkisiyle açıklamak güç. Aynı makalede Qwen3-8B'ye istem (prompt) düzeyinde BPE harness eklenen EvoHarness-Base, 'seen' bölümünde yüzde 56,4; gözetimli öğrenme sürümü EvoHarness-SFT ise yüzde 68,6 başarı oranı kaydetti.

'Unseen' bölümünde ise EvoHarness-Base yüzde 77,6, EvoHarness-SFT yüzde 69,4, EvoHarness-RL yüzde 86,6 oranına ulaştı. Yani hem harness yapısının kendisi hem de bunun ne zaman kullanılacağını öğrenen politika birlikte devreye giriyor.

Harness, LLM ajanlarını gerçek görev ortamlarında harekete geçiren yürütme katmanı olarak tanımlanıyor. Modelin neyi hatırlayacağını, hangi aracı çağıracağını, başarısızlık durumunda hangi duruma döneceğini ve görev kaydını nasıl tutacağını yönetiyor.

Bu konu Türkiye'deki yapay zeka ve kripto para okurları için de önemsiz değil. Ajanlar zincir üstü analiz, cüzdan takibi, güvenlik kontrolü ve otomasyon destek görevlerinde kullanıldıkça, model adından çok yürütme yapısının doğrulanabilirliği öne çıkıyor. TokenPost daha önce harness tasarımının model eğitiminden bağımsız bir performans artışı ekseni olarak kullanıldığını aktarmıştı.

Uzun soluklu görevlerde çalışan ajanlarda tek seferlik yanıttan çok, çok adımlı yürütme, durum takibi ve hata kurtarma önem taşıyor. Kurumsal yapay zeka ajanları arasındaki rekabetin de model performansından, bağlam yönetimi, yetkilendirme, hata kurtarma ve doğrulama sistemlerini kapsayan işletim sistemine kaydığı yönünde değerlendirmeler sürüyor.

Yine de yayımlanan veriler daha çok kıyaslama (benchmark) deneyleri ve kavram kanıtlama niteliğinde. Gerçek kurumsal işletim ortamında gecikme süresi, maliyet, güvenlik ve arıza kurtarma gibi konularda test edilip edilmediği doğrulanamadı.

Makalenin ortaya koyduğu nokta, ajan performansındaki darboğazın yalnızca model büyüklüğünde değil, dış durumu ele alma biçiminde de bulunduğu. Araştırmacılar, EvoHarness-RL'nin 2026 COLM Uzun Soluklu Dil Ajanları Çalıştayı'na (LLA@COLM 2026) kabul edildiğini belirtti.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1