Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

28 karşılaştırmanın 17'sinde üstün: Claude Code kod alanında 7-0

Tencent(0700.HK)'in yayımladığı yapay zeka kodlama ajanı karşılaştırmasında, Anthropic'in Claude Code'u aynı temel modellerle yapılan 28 karşılaştırmanın 17'sinde CodeBuddy Code'u geride bıraktı. Kod alanında test edilen 7 modelin tamamı, Claude Code üzerinden çalıştırıldığında daha yüksek puan elde etti.

Tencent Youtu Lab, Keen Security Lab, Winding Security Lab ve WorkBuddy ekipleri, gerçek iş süreçlerinden tersine mühendislikle türetilen 260 görevlik WorkBuddy Bench'i duyurdu. Görevler 80 kod, 70 web, 50 ofis ve 60 güvenlik başlığı altında toplandı. Ekip, 7 modeli CodeBuddy ve Claude Code adlı iki ayrı çalıştırma altyapısında (harness) test ederek performansları karşılaştırdı.

Harness, modelin dışında bağlam yönetimini, araç çağrılarını ve görev yürütmeyi üstlenen ajan katmanı anlamına geliyor. Değerlendirmede temel model aynı kalsa bile sonuçlar kullanılan harness'e göre değişti. Web ve ofis alanlarında CodeBuddy sırasıyla 4-3'lük skorla önde çıkarken, güvenlik alanında Claude Code aynı skorla üstünlük sağladı.

Detay puanlarda da fark göze çarpıyor. GLM-5.2'nin web puanı iki harness'te sırasıyla 67,43 ve 60,71 olarak ölçüldü; GPT-5.5'in güvenlik puanı ise 77,91 ve 64,39 çıktı. Lider tablosu CodeBuddy 2.109.3 ile Claude Code 2.1.187 sürümleri sabit tutularak oluşturuldu ve puanlar think modunda üç kez çalıştırmanın ortalaması alınarak hesaplandı.

Sonuçlar, yapay zeka kodlama araçları değerlendirilirken yalnızca temel modelin değil, çalıştırma yapısının ve araç kontrol biçiminin de incelenmesi gerektiğini gösteriyor. Claude Code'un webde tanımlanan bağlayıcıları (connector) terminal ve API'ye genişlettiği örnekte olduğu gibi, gerçek iş araçlarını, yetkileri ve çalışma ortamını birbirine bağlayan yapı, performansı ve kullanım alanını doğrudan etkileyebiliyor.

Ancak değerlendirme, alan başına 50 ila 80 görevle ve yalnızca iki harness karşılaştırmasıyla sınırlı kaldı. BlockBeats'e göre bazı topluluk üyeleri, listeye daha zor problemler eklenmesi halinde sıralamanın değişebileceğini belirtirken, Codex'in karşılaştırmaya dahil edilmediğine de dikkat çekti.

WorkBuddy Bench, herkese açık bir depo ve Hugging Face veri seti üzerinden erişime açıldı. Veri setinde her görevin talimatları, çalışma ortamı ve test yapılandırması yer alıyor. Tencent, bu çalışmayı araştırma amaçlı bir önizleme lider tablosu olarak sunduğunu ve model ile harness değişikliklerini yansıtarak güncelleyeceğini açıkladı.

Doğrulama kaynakları: Tencent WorkBuddy Bench, WorkBuddy Bench Lider Tablosu, Hugging Face veri seti.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1