Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Nvidia(NVDA), yapay zeka becerilerini 947 çalıştırmayla test etti

Dizüstü bilgisayarın yanında duran beceri değerlendirme kartı ve kontrol listesi / TokenPost.ai

Nvidia(NVDA), yapay zeka ajanları için geliştirilen 'skill'lerin (beceri) yalnızca belge kalitesine göre değil, gerçek çalıştırma sonuçlarına göre değerlendirilmesi gerektiğini öne süren yeni bir yöntem ortaya koydu. Şirket, 145 gerçek beceriyi ve 947 eşleştirilmiş çalıştırma örneğini inceleyerek her becerinin görev başarısına ne kadar katkı sağladığını sayısal olarak ortaya koydu.

Nvidia araştırmacıları, 20'sinde (yerel saatle) arXiv üzerinde yayımlanan 'Evaluating Skills, Not Just Agents' başlıklı makalede ACES (Agentic Continuous Evaluation of Skills) adlı yöntemi tanıttı. ACES, aynı görevi beceri açık ve beceri kapalı olmak üzere iki farklı koşulda çalıştırıp aradaki farkı 'Skill Lift' olarak ölçüyor.

Makaleye göre statik yapı puanlaması ile büyük dil modeli (LLM) tabanlı değerlendirme puanları arasındaki korelasyon Spearman ρ=0.14 gibi düşük bir seviyede kaldı. Aynı koşullarda ortalama bileşik Skill Lift değeri 0.2134 olarak ölçülürken, pozitif lift elde edilen oranın yüzde 72,8 olduğu belirtildi.

Skill Lift, mutlak bir performans göstergesi değil; aynı koşullar altında beceri devrede olduğunda ortaya çıkan net ek katkıyı ifade ediyor. Görev dağılımı, kullanılan model, değerlendirme altyapısı, çalışma alanı (workspace) ve puanlayıcı değiştikçe bu değerin de değişebileceği vurgulandı.

Buradaki temel yaklaşım, becerilerin sadece birer açıklama dokümanı değil, 'çalıştırılabilir ajan bileşenleri' olarak ele alınması. Makalede beceriler; SKILL.md dosyası, isteğe bağlı komut dosyaları, referans materyaller ve örneklerden oluşan bir paket olarak tanımlandı.

Bu yapı, ajanın yalnızca ihtiyaç duyduğu anda ilgili materyali okuduğu 'progressive disclosure' (kademeli açığa çıkarma) mantığına dayanıyor. Beceri kataloğu büyüdükçe tüm talimatları bir kerede okumak yerine yalnızca gerekli talimatları çağırmanın önemi artıyor.

Mevcut kontrol yöntemleri dosya biçimi, ön bilgi (frontmatter) alanları, komut dosyası söz dizimi ve güvenlik desenlerini doğrulamada güçlü. Ancak bir ajanın söz konusu beceriyi gerçekten bulup bulmadığını, doğru parametreleri kullanıp kullanmadığını ve görevi sonuna kadar tamamlayıp tamamlamadığını bu yöntemlerle görmek zor.

ACES bu boşluğu canlı A/B test çalıştırmalarıyla kapatmayı hedefliyor. Odak noktası, becerinin belgelerde ne kadar düzenli göründüğü değil; gerçek çalıştırma sırasında bulunup çağrılıp görevi tamamlayıp tamamlamadığı.

Nvidia'nın teknik blogu da SkillEvaluator adlı aracı herkese açık bir değerlendirme aracı olarak duyurdu. Şirket blog yazısında 300'den fazla doğrulanmış (verified) beceri ve 30'dan fazla ürünü kapsayan üç aşamalı bir değerlendirme yaptıklarını, Doğruluk (Correctness), Bulunabilirlik (Discoverability), Etkinlik (Effectiveness) ve Verimlilik (Efficiency) alanlarında ortalama 31 puanlık, güvenlik hariç tutulduğunda ise 39 puanlık bir iyileşme gözlemlediklerini belirtti.

Bu rakamlar, makaledeki 145 beceri üzerinden yapılan deneyle aynı kapsamda değil. Makale, yöntemsel düzeyde ACES ve Skill Lift'i ele alırken; blog yazısı daha çok ürün kataloğu ölçeğinde bir kıyaslama (benchmark) deneyini konu alıyor.

SkillEvaluator dokümantasyonu bu aracı açık kaynaklı, çok katmanlı bir çerçeve olarak tanımlıyor. Tier 1 statik doğrulamayı, Tier 2 yinelenen ya da benzer içerik kontrolünü, Tier 3 ise gerçek ajanlar üzerinde yapılan canlı değerlendirmeyi kapsıyor.

GitHub deposundaki açıklamalara göre SkillEvaluator; kalite kapıları (quality gates), anlamsal yineleme tespiti, sentetik değerlendirme verisi üretimi ve canlı ajan değerlendirmesini bir arada sunuyor. Bu da beceri doğrulamanın artık yalnızca belge denetimi seviyesinde kalmayıp dağıtım (deployment) sürecinin bir aşamasına dönüştüğünü gösteriyor.

Nvidia blog yazısında Claude Code, Codex ve Cursor için geliştirilen eklentilere de değindi. Bu da makalenin yalnızca araştırma önerisi düzeyinde kalmadığını, gerçek beceri dağıtımı ve doğrulama hattına bağlandığını gösteriyor.

Bu gelişme, TokenPost'un daha önce ele aldığı Nvidia'nın kurumsal yapay zeka genişleme sürecine dair haberle de örtüşüyor. Kurumsal yapay zekanın yalnızca modelin kendisiyle sınırlı kalmayıp araçlar, beceriler ve değerlendirme sistemlerini de kapsayan bir operasyonel altyapıya doğru genişlediği görülüyor.

Ancak uygulamaya geçişte hâlâ bazı engeller var. SkillEvaluator dokümantasyonu destek seviyesini 'Experimental' (deneysel) olarak tanımlıyor; topluluk temelli, 'best-effort' destek sunulduğunu ve herhangi bir hizmet seviyesi taahhüdü (SLA) bulunmadığını açıkça belirtiyor. Gerçek üretim ortamlarında tekrarlanabilirlik, çalıştırmalar arası değişkenlik ve değerlendirme maliyetinin birlikte ele alınması gerekiyor.

Bu açıklama kripto para piyasasıyla doğrudan bağlantılı bir gelişme değil. Ancak ajanlar, araç zincirleri (toolchain) ve beceri kataloglarını işleten yapay zeka altyapısı açısından anlamlı bir haber. Beceri değerlendirmesinin ölçütü 'iyi yazılmış belge' olmaktan çıkıp 'işi gerçekten bitiren çalıştırılabilir birim' olmaya doğru kayıyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1