Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

111 testte ortaya çıktı: Scale AI'nin yeni yapay zeka benchmarkı HarnessOpt-Bench

Değerlendirme grafiklerinin ve dizüstü bilgisayarın bulunduğu bir araştırma masası / TokenPost.ai

Scale AI, büyük dil modellerinin (LLM) bir yapay zeka ajanının çalışma altyapısını -yani 'harness'ini- doğrudan değiştirerek performansı artırıp artıramadığını ölçen HarnessOpt-Bench adlı yeni bir test setini duyurdu. Değerlendirme, modellerin yalnızca doğru cevap üretme becerisine değil; istem (prompt), araçlar, kontrol akışı, bellek ve orkestrasyon koduyla oynama yeteneğine de bakıyor.

Scale AI, 6 Ağustos'ta (yerel saatle) yayımladığı makalede harness'i modelin dışında çalışan istem, araç, bellek, kontrol akışı ve orkestrasyon kodu olarak tanımladı. Şirket, aynı modelin bile kullanılan harness'e göre farklı görev performansı sergileyebildiği gözleminden yola çıktığını aktardı.

Testin kurgusu şöyle işliyor: 'optimizasyon modeli' adı verilen sistem, hedef ajanın başlangıç harness'ini, değerlendirme geri bildirimini ve sabit bir değerlendirme bütçesini alıyor; ardından kodu düzenleyip nihai bir aday sürüm sunuyor. Nihai puan, arama sürecinde erişilemeyen gizli bir test bölümünde başlangıç harness'ine kıyasla ne kadar iyileşme sağlandığına göre hesaplanıyor. Değerlendirme sınırları ve bütçe, güvenilir bir çalışma ortamında yönetiliyor.

Scale AI, deneyde Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol, GPT-5.6 Terra ve Kimi K3 olmak üzere 5 öncü modeli optimizasyon modeli olarak test etti. Görevler OfficeQA, BrowseComp Plus, TerminalBench ve GAIA olmak üzere 4 kalemden oluştu; toplamda 111 puanlama koşumu gerçekleştirildi.

Sonuçlara göre modelin kendisindeki fark, harness farkından daha belirleyici çıktı. Şirketin açıklamasına göre görev ve harness sabit tutulup optimizasyon modeli değiştirildiğinde ortalama kazanç 0,142 puan hareket ederken; görev ve model sabit tutulup harness değiştirildiğinde bu hareket 0,079 puanda kaldı. Buna karşın modelin kendi 'native' harness'i her zaman daha iyi sonuç vermedi.

Görev bazında sonuçlar da birbirinden ayrıştı. OfficeQA'da Claude Opus 5 ile OpenCode kombinasyonu 0,63 normalize kazanç kaydetti. GAIA'da ise GPT-5.6 Sol ile Codex kombinasyonu 0,49 puan gösterdi. Scale AI, görev bazlı ölçüm gürültüsünün altında kalan farkları kesin bir fark olarak değerlendirmediğini belirtti.

BlockBeats, bu testi yapay zekanın bir araştırmacı gibi deney tasarlayıp eğitim çalıştırarak yöntemini düzeltip düzeltemediğini ölçen bir sınav olarak nitelendirdi. Yayına göre bazı modeller deney yürütme, parametre ayarlama ve tekrarlı iyileştirme adımlarını uygulayarak bazı görevlerde referans çizgisini aşarken, güncel araştırmalara yönelik denemeler çoğunlukla mevcut makale yöntemleri ve ince ayarla sınırlı kaldı.

Bu sonuçlar, yapay zeka ajanı değerlendirmesinde odağın yalnızca model performansından çalışma altyapısına doğru genişlediğini gösteriyor. Yapay zeka ajanları kodlama, araştırma ve terminal işleri gibi araçların uzun süre kullanıldığı alanlara doğru yayılıyor. Yayınımız daha önce Tencent'in WorkBuddy Bench testinin gerçek iş görevlerine dayanarak kodlama ajanlarını karşılaştırdığını aktarmıştı.

Scale AI'nin makalesi, harness optimizasyonunu tekrarlanabilir bir değerlendirme konusu haline getirmesiyle öne çıkıyor. Yine de mevcut sonuçlara bakarak yapay zekanın bağımsız biçimde yeni araştırma fikirleri ürettiğini söylemek için henüz erken.

Doğrulama kaynakları: Scale Labs HarnessOpt-Bench makalesi (https://labs.scale.com/papers/harnessopt-bench), makale PDF'i (https://static.remotasks.com/uploads/6a74bd9cebda5487911dfbc2/HarnessOpt-Bench.pdf), BlockBeats haberi (https://www.theblockbeats.info/flash/362187)

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1