Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

24 kombinasyonun 21’inde en iyi veya ortak en iyi sonuç: Google araştırmacılarından prosedürel grafik önerisi

Araştırma laboratuvarının beyaz tahtasına çizilmiş prosedürel grafik / TokenPost.ai

Büyük dil modeli (LLM) ajanlarının görev süreçlerini grafiklerle yapılandırmak, uzun süreli görevlerde performansı artırabilir. Araştırmacılar, 7 benchmark ve 4 LLM’i değerlendirdi; 24 model-benchmark kombinasyonunun 21’inde en iyi veya ortak en iyi sonucu elde etti.

Yuxing Lu, Yicheng Chen, Shanchan Wu ve Sercan Ö. Arık, 8 Eylül’de arXiv’de yayımlanan makalede ‘Procedural Graphs: A Self-Evolving Execution Structure for LLM Agents’ yaklaşımını önerdi. Makaleye Google araştırmacıları ve akademik araştırmacılar katıldı ancak Google tarafından ayrıca yapılmış resmi bir açıklama veya ticarileştirme takvimi sunulmadı.

Prosedürel grafikler, bilgi grafiklerinin gerçekleri ‘varlık-ilişki-varlık’ biçiminde saklamasına benzer şekilde görev sırasını ve koşulları ‘prosedür-ilişki-prosedür’ yapısıyla ifade ediyor. Düğümler araç çağrılarını, çıkarım adımlarını ve görev durumlarını temsil ederken bağlantılarda geçiş koşulları, uygulama talimatları ve kaçınılması gereken hatalar tutuluyor.

Ajan, görev sırasında grafikteki mevcut konumunu belirliyor ve iki adım çevresindeki yapıyı guidance modeline iletiyor. Guidance modeli bu bilgiyi mevcut duruma uygun talimatlara dönüştürerek solver’a sunuyor ancak nihai eylemi zorunlu kılmıyor. Araştırmacılar, yöntemin serbest çıkarım ile prosedürel kontrolü birlikte koruyacak şekilde tasarlandığını belirtti.

Grafik, uygulama sonuçlarına göre kendisini güncelliyor. LLM tabanlı refiner, başarılı ve başarısız görevleri karşılaştırarak düğüm ve bağlantı değişiklikleri öneriyor. Değişiklikler yalnızca ayrı bir doğrulama setinde performans korunur veya iyileşirse uygulanıyor. Kabul edilmeyen öneriler ise aynı değişikliklerin tekrar tekrar sunulmasını önlemek için olumsuz kayıt olarak saklanıyor.

Bu yaklaşım, AI ajanları arasındaki rekabetin model performansından şirket sistemlerine kaydığı yönündeki eğilimle örtüşüyor. Yöntem, modelin kendisini yeniden eğitmek yerine harici yürütme yapısını düzenleyerek uzun süreli görevlerde ortaya çıkan hataları azaltmayı hedefliyor.

Araştırmacılar HotpotQA, MultiChallenge, GDPval, ALFWorld, τ-bench, BFCL v3 ve EnterpriseArena olmak üzere 7 benchmark ile Claude Sonnet 4.6, Gemini 3.1 Pro, Gemini 3.5 Flash ve Grok 4.1 Fast olmak üzere 4 LLM’i değerlendirdi.

Prosedürel grafikler, 24 model-benchmark kombinasyonunun 21’inde en iyi veya ortak en iyi performansı gösterdi. Ancak iyileşme oranı tüm görevlerde aynı olmadı ve bazı soru-cevap görevlerinde performans farkı sınırlı kaldı.

Uzun süreli görevleri ölçen EnterpriseArena’da Gemini 3.1 Pro’nun toplam hayatta kalma oranı, geleneksel yöntemdeki %6’dan grafik uygulandıktan sonra %34’e yükseldi. Bu, 28 yüzde puanlık artış anlamına geliyor. EnterpriseArena, ajanın uzun süre boyunca kurumsal finans kararları aldığı bir simülasyon sunuyor; finansman kararlarının gerçeğe yansıması 1 ila 6 ay sürüyor ve sistemin birden fazla ekonomik krizle başa çıkması gerekiyor.

Bu ortamda sonuçları yalnızca tek tek soruları yanıtlama becerisi değil, önceki kararları ve görev koşullarını uzun süre koruyabilme yeteneği de etkiliyor. Prosedürel grafikler, önceki adımlardaki prosedürleri ve koşulları yapılandırarak sonraki eylem seçimine referans sağlıyor.

Kendini geliştirme deneyinde doğrulama setindeki hayatta kalma oranı %0’dan %90’a yükseldi. Nihai grafiğin test setindeki hayatta kalma oranı ise %85 oldu. Araştırmacılar, deneyin her bölümlendirme için 20 epizoda dayandığını ve bu nedenle tek tek değişikliklerin kabul edilmesinin bir veya iki epizoddan etkilenebileceğini belirtti.

Kamuya açık değerlendirmeler ağırlıklı olarak bağımsız araştırma notları ve makale özetlerinden oluşuyor. Prosedürel grafiklerin basit sohbet kayıtları veya metin tabanlı hafızaya kıyasla sonraki eylemleri kontrol etmeyi kolaylaştırabileceği ifade edilirken, doğrulama setine dayalı otomatik kabul mekanizmasının grafikteki koşulların gerçek ortamda da doğru olduğunu tek başına garanti edemeyeceği yönünde eleştiriler de bulunuyor.

Şu ana kadar Google’ın resmi ürünlerinde kullanım, kurumsal müşteri uygulaması veya ilgili bir hizmet lansmanı doğrulanmadı. Sanal varlık ve blokzincir sektörüyle doğrudan bir bağlantı da sunulmadı.

Çalışma, hakemli bir akademik dergi makalesine veya bağımsız bir kurumun yeniden üretim sonuçlarına değil, arXiv ön baskısına dayanıyor. Bu nedenle sonuçlar, yapılandırılmış prosedürel bilginin belirli benchmark ve model kombinasyonlarında etkili olabileceğini gösteren bulgular olarak değerlendirilmelidir.

Grafik araması ve guidance üretimi ek çıkarım ile token kullanımı gerektiriyor. Doğruluk ve uzun süreli hayatta kalma oranı artsa bile işletme maliyetleri ve gecikme süresi yükselebilir. Hatalı grafik değişikliklerinin birikme riski de ayrıca incelenmeli.

Prosedürel grafiklerin LLM ajanlarının uzun süreli yürütme sorunlarını azaltabileceği öne sürülse de gerçek hizmet ortamlarındaki tekrarlanabilirlik ve sektör bazındaki etkiler ek araştırma konusu olmaya devam ediyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1