Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Anthropic müşteri destek yapay zekâsında maliyet beşte bire indi, doğruluk %90,5'e çıktı

Müşteri destek değerlendirme örneklerini ayıran eller / TokenPost.ai

Anthropic'in müşteri destek yapay zekâsı örneğinde yanıt doğruluğu %78,6'dan %90,5'e yükselirken, işlem başına maliyet mevcut seviyenin yaklaşık beşte birine geriledi.

Anthropic, 28 Eylül'de geliştirici blogunda Claude Code'da kullanılabilen 'claude-api' becerisine 'build-eval' ve 'hillclimb' komutlarını eklediğini açıkladı. build-eval, gerçek operasyon kayıtları ve müşteri destek taleplerinden değerlendirme setleri oluşturuyor. hillclimb ise değerlendirme sonuçlarına göre istemleri, modeli ve parametreleri aynı anda yalnızca birini değiştirerek ayarlıyor. Ayrıntılar Anthropic'in resmi geliştirici blogunda yayımlandı.

Müşteri destek değerlendirmesinde 44 talep kullanıldı. Bunların 30'u ayarlama sürecinde değerlendirilirken, 14'ü nihai doğrulama için ayrı tutuldu.

Başlangıç noktası, yüksek akıl yürütme yoğunluğuna sahip Opus 4.8 modeliydi. Ayarlama taleplerinde karar doğruluğu %74,4, talep başına token maliyeti ise 4,6 sentti (yaklaşık 62 won).

Claude önce istemi inceleyerek zorunlu araç çağırma adımlarını, taslak oluşturma aşamasını ve birbiriyle çelişen kuralları kaldırdı. Ardından düşük akıl yürütme yoğunluğuna sahip Opus 5.5 uygulandığında doğruluk %87,8'e yükseldi, maliyet ise talep başına 1,9 sente (yaklaşık 26 won) düştü.

Opus 5.5'in girdi ve çıktı token fiyatları Opus 4.8'e göre %20, önbellek okuma maliyeti ise %60 daha düşük. Anthropic, model değişikliğiyle istem düzenlemesinin maliyet düşüşüne birlikte katkı sağladığını belirtti.

Anthropic daha ucuz olan Sonnet 5'i de test etti. Düşük akıl yürütme yoğunluğuna sahip Sonnet 5, yaklaşık %88,9 doğruluk sağlarken maliyeti talep başına yaklaşık 1 sente (yaklaşık 14 won) indirdi.

İsteme talep sınıflandırma kuralları ile geri ödeme limitlerini çapraz kontrol etme adımı eklendiğinde, ayarlama taleplerindeki doğruluk %98,9'a çıktı. Ayrı tutulan 14 doğrulama talebinde nihai yapılandırma %90,5 sonuç verdi ve mevcut yapılandırmadaki %78,6 seviyesini aştı.

hillclimb yönteminin temel özelliği, değişiklik önerilerinin tek seferde yalnızca bir tanesini uygulaması. Değerlendirme seti ayarlama ve doğrulama bölümlerine ayrıldıktan sonra yalnızca ayarlama sonuçları inceleniyor ve değişiklik önerileri oluşturuluyor. Ayarlama puanı yükselirken doğrulama puanı değişmiyorsa bu durum aşırı uyum olarak kabul edilerek değişiklik geri alınıyor.

Aşırı uyum, değerlendirme verilerinde performans artmasına rağmen gerçek ortamda aynı iyileşmenin görülmemesi anlamına geliyor. Anthropic, değerlendirme maddelerine görseldeki metinleri tanımanın dahil edilmesi halinde ayarlama sürecinde OCR aracı eklenebileceğini, ancak bunun gerçek kullanım ortamında fayda sağlamayabileceğini belirtti.

build-eval, öncelikle operasyon ortamındaki konuşma kayıtlarını inceliyor. Ardından hata raporları ve müşteri destek talepleri, geliştiricilerin doğrudan yazdığı 5-10 örnek ve kodla oluşturulan sentetik örnekler sırayla girdilere ekleniyor. Geliştiriciler her girdiyi kontrol ettikten sonra bunlar değerlendirmeye dahil ediliyor.

Çıktı formatı önceden belirlenmişse puanlama için mümkün olduğunca düşük maliyetli, kod tabanlı yöntem kullanılıyor. Serbest biçimli sonuçlarda ise ayrı bir model değerlendirici olarak görevlendiriliyor. Anthropic, değerlendirici olarak değerlendirmeye alınan modelin kendisinin kullanılmamasını önerdi.

Anthropic, iyi bir değerlendirme sürecinin gerçek operasyon ortamını yansıtması ve daha güçlü modelle daha yüksek akıl yürütme yoğunluğunda puanın yükselmesi gerektiğini açıkladı. Şirket ayrıca en üst düzey modelin bile %100'e ulaşmaması ve tekrarlı çalıştırmalarda puan değişiminin düşük kalması gerektiğini belirtti.

Yalnızca belirli bir modelin başarısız olduğu sorunlar değerlendirmeye alınırsa, uygulamanın gerçek zorluğu yerine o modelin zayıflıkları ölçülebilir. Anthropic, bu yanlılığı azaltmak için operasyon verileriyle hata örneklerinin birlikte kullanılması gerektiğini belirtti.

Anthropic aynı yöntemi claude-api becerisinin kendisine de uyguladı. Bu değerlendirmede geçme oranı %66'dan yaklaşık %88'e yükseldi. Süreçte eksik özellikler, programlama dillerine göre dokümantasyon hataları ve sorunlarla puanlama kriterlerinin örtüşmediği örnekler tespit edilerek düzeltildi.

Güncellemenin önemi, model seçimiyle istem ayarlamasını ayrı çalışmalar olarak yürütmek yerine tekrarlanabilir bir değerlendirme süreci içinde birleştirmesinde yatıyor. Ancak bu sonuçlar Anthropic'in kendi müşteri destek örneğinden elde edildi. Diğer hizmetlerde aynı iyileşmenin görülüp görülmeyeceği, değerlendirme verileri ve puanlama yöntemine bağlı olarak değişebilir.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1