Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Salesforce AI ajanlarında başarı oranı %43,5'ten %93'e yükseldi

Dizüstü bilgisayarda devam eden web görevi değerlendirmesi / TokenPost.ai

Salesforce AI ajanlarının web görevlerindeki başarı oranı, model ağırlıkları değiştirilmeden %43,5'ten %93'e yükseldi. Araştırmacılar performansı; istemleri, araçları, belleği ve kontrol akışını kapsayan yürütme yapısını evrimleştirerek artırdı.

Salesforce (Salesforce, $CRM) AI Research ve Agentforce bünyesindeki 12 araştırmacı, 31 Temmuz 2026'da sundukları 'DarwinX: Evolving Agent Harnesses Through Natural Selection' başlıklı makalede bu sonuçları ortaya koydu. Makale, yapay zeka modelini yeniden eğitmeden görev yürütme yapısını geliştiren bir çerçeveyi açıklıyor.

DarwinX'in değiştirdiği unsur 'harness' olarak adlandırılıyor. Harness, yapay zeka modelinin istemler, araçlar, bellek, beceriler ve kontrol akışı aracılığıyla gerçek görevleri yerine getirmesini sağlayan yürütme yapısını ifade ediyor.

DarwinX, tek bir geliştirme yolunu tekrarlamak yerine aynı anda birden fazla harness varyasyonunu koruyor. Önceki görevleri büyük ölçüde bozmayıp yeni görevleri çözen varyasyonlar korunuyor ve farklı varyasyonlardan elde edilen işlevler birleştiriliyor.

En büyük gelişme WebArena-Infinity değerlendirmesinde görüldü. Aynı GPT-5.5 modeli kullanıldığında temel harness'in denetim sonrası pass@1 oranı %43,5 olurken, DarwinX uygulanan harness %93,0'a ulaştı.

pass@1, bir görevin tek denemede başarıyla tamamlanma oranını gösteriyor. Toplam 1260 gerçek web görevi içindeki başarılı görev sayısı, temel harness'te 548 iken DarwinX sonrasında 1171'e çıktı.

Başarı sürecinin uygunluğu da denetime dahil edildi. Makaleye göre geçersiz yörüngeler temel harness'teki 293'ten DarwinX sonrasında 17'ye geriledi; değerlendirme alanlarına veya ayrıcalıklı sunuculara erişim içeren türler ise ortadan kalktı.

Bununla birlikte söz konusu denetim, araştırmacıların oluşturduğu yörüngelere uygulandı. Harici karşılaştırma gruplarına aynı inceleme uygulanmadığı için performans verilerini güvenlik açısından doğrudan karşılaştırmak mümkün değil.

Diğer değerlendirmelerde de gelişme kaydedildi. Terminal-Bench 2.1'de GPT-5.5 bazında performans %75,5'ten %83,2'ye yükselirken, GPT-5.6 Sol %84,7 oranına ulaştı.

Ayrı bir bekletilen görev seti olan TerminalWorld'de 41 görevin 28'i çözüldü. Terminal-Bench 2.1'de evrimleştirilen harness'in SWE-bench Verified'a herhangi bir değişiklik yapılmadan uygulanması sonucunda başarı oranı %84,2 oldu.

Araştırmacılar, tek bir harness'i yalnızca bir yol üzerinden geliştirmenin bazı görevlerde performansı artırırken diğer görevlerde gerilemeye yol açabileceğini belirtti. DarwinX'in aynı anda birden fazla soy hattını koruyan yaklaşımı, bu performans yanlılığını azaltmaya odaklanıyor.

Değerlendirmelerde her benchmark'ın doğrulayıcıları kullanıldı. Yöntemin öne çıkan yönü, ayrı bir cevap anahtarına veya araştırmacıların seçtiği kazanan varyasyona dayanmak yerine görev bazındaki doğrulama sonuçlarıyla harness performansını karşılaştırması oldu.

Bu çalışma, AI ajanlarının yürütme deneyimlerini bilgi olarak biriktirerek performansı artıran WikiSkills araştırmasıyla birlikte model parametrelerini doğrudan değiştirmeden performans geliştirme eğilimini ortaya koyuyor. WikiSkills başarı ve başarısızlık izlerini bilgi yapısına dönüştürürken DarwinX, istemleri, araç kullanımını ve kontrol akışını kapsayan yürütme yapısının kendisini evrimleştirdi.

Bununla birlikte, Agentforce'un iş göstergelerinin çeyreklik gelir yerine yıllık yinelenen gelir olarak sunulduğu örnekte olduğu gibi araştırma sonuçları ile ticari sonuçları birbirinden ayırmak gerekiyor.

Makale araştırma aşamasındaki sonuçları sunuyor ve gerçek ürün dağıtımı ya da gelir etkisine ilişkin veri vermiyor. Harness'lerin yeniden birleştirilmesinin tek bir soy hattındaki mutasyona kıyasla katkısı kontrollü bir ablasyon deneyiyle ayrıştırılmadığı için, gerçek hizmet ortamındaki tekrarlanabilirlik ve işletme maliyetleri için ek doğrulama gerekiyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1