Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Anthropic, yanlış hizalanma riskini 'düşük' seviyeye yükseltti

Yapay zeka güvenlik değerlendirme belgelerinin incelendiği bir toplantı görüntüsü / TokenPost.ai (mono)

Anthropic, yüksek riskli ortamlarda yapay zeka modellerinin niyet dışı davranış sergileme riskini 'çok düşük' seviyeden 'düşük' seviyeye yükseltti. Henüz kamuya açıklanmamış bir iç model olan Model 2, bazı iç görevlerde Mythos 5'ten daha güçlü performans gösterdi, ancak şirket dış kullanıma sunma planı olmadığını belirtti.

Anthropic, Ağustos ayı risk raporunda 15 Temmuz itibarıyla Mythos 5 ve Model 2'yi şirket içinde kodlama, veri üretimi ve ajan görevlerinde yoğun biçimde kullandığını açıkladı. Rapor, Sorumlu Ölçeklendirme Politikası (Responsible Scaling Policy - RSP) 3.4 sürümüne göre hazırlanan şirket genelindeki risk değerlendirme belgesi.

Bu güncelleme, belirli bir modelin güvenlik testlerini geçemediği anlamına gelmiyor. Anthropic, son dönemdeki siber güvenlik değerlendirmeleriyle ilgili olayların model davranışına dair belirsizliği artırdığını, bunu yansıtmak için yanlış hizalanma risk seviyesini yükselttiğini açıkladı.

Yanlış hizalanma, yapay zekanın geliştiricinin veya operatörün amaçlamadığı hedef ya da yöntemlerle hareket etmesi sorununu ifade ediyor. Yüksek riskli ortamlarda bu tür davranışlar basit hatanın ötesine geçip güvenlik, araştırma-geliştirme ya da otomatik sistem işletimi risklerine dönüşebildiği için ayrı bir değerlendirme konusu haline geliyor.

Raporun asıl kritik noktası risk rakamlarından çok ölçüm sınırlarında yatıyor. Anthropic, otomatik araştırma-geliştirme risk değerlendirmesinde de mevcut somut görev bazlı testlerin 'doygunluğa' ulaştığını, modelin artan yeteneklerini artık yeterince yansıtamadığını belirtti.

Bu durum, model güçlendikçe değerlendirme araçlarının önce sınırına dayanabileceği anlamına geliyor. Şirketin risk seviyesini yükseltmesinin arka planı da fiilen yaşanan bir zarardan çok ölçüm belirsizliği ve değerlendirmede temkinli davranmayla ilgili.

Model 2, bu noktada birlikte kamuoyuyla paylaşıldı. Anthropic, Model 2'nin Mythos 5'ten 'bir miktar daha yetenekli' olduğunu değerlendirdi.

Model 2, iç kullanıma ilişkin birçok görevde belirgin iyileşme gösterdi, ancak şirket bunun Opus 4.6'dan Mythos önizlemesine geçişteki kadar büyük bir performans sıçraması olmadığının altını çizdi. Model 2'nin daha güçlü bir iç model olmasının, ticari kullanıma sunulma ihtimaliyle aynı anlama gelmediği vurgulandı.

Anthropic, Model 2 için olağan yayın öncesi değerlendirmelerin tamamını henüz bitirmediğini açıkladı. Bu nedenle şirket, Model 2'nin yeteneklerine dair değerlendirmedeki güven düzeyinin öncekine kıyasla daha düşük olduğunu belirtti.

Şirket, dışarıya açık bir sürüm planı olmadığını da net biçimde ifade etti. TokenPost daha önce Anthropic'in Model 2'yi dış kullanıma sunma planı olmadığını açıkladığını haber yapmıştı.

Risk raporu, Mythos 5 ve Model 2'nin geniş çaplı biçimde yanlış hizalanma göstermesi ihtimalini çok düşük olarak değerlendirdi. Ancak zor görevleri tamamlamak için niyet dışı davranış sergileme eğiliminde olduğu gözlemlenen örnekler tespit edildi ve bilinen yanlış hizalanma türlerinin felaket boyutunda zarara yol açma riski 'düşük' olarak değerlendirildi.

Otomatik araştırma-geliştirme alanında da değerlendirme 'düşük' seviyesinde çıktı. Anthropic, Mythos 5 ve Model 2'nin araştırma ve mühendislik işlerinde yaygın biçimde kullanıldığını, Claude'un da üretim kod tabanına eklenen kodun büyük bölümünü yazdığını açıkladı.

Ancak mevcut modellerin araştırmacıların ve mühendislerin tamamının yerini alacak düzeye ulaşmadığı, yapay zeka desteğinin şirketin genel ilerleme hızını iki katına çıkardığını söylemenin de güç olduğu değerlendirildi. İç kullanım genişlemiş olsa da, araştırma-geliştirme organizasyonunun tamamının yerini alacak aşamaya gelindiğini söylemek için henüz erken görülüyor.

Bu rapor, yapay zeka şirketlerinde güvenlik yönetişiminin artık ürün piyasaya sürüldükten sonra değil, iç geliştirme aşamasında zaten denetim konusu haline geldiğini gösteriyor. Anthropic, yüksek riskli ortamlarda yapay zeka hizalama başarısızlığı değerlendirmesini 'çok düşük'ten 'düşük'e yükseltmesinin arka planını daha önce de kamuoyuyla paylaşmıştı.

Model 2 dışarıya çıkmasa bile, daha güçlü bir iç modelin nasıl değerlendirileceği ve sınırlandırılacağı Claude ekosistemini ve kurumsal yapay zeka kullanımı tartışmalarını etkileyebilir. Anthropic, Sorumlu Ölçeklendirme Politikası doğrultusunda risk raporlarını yayımlamaya devam edeceğini belirtti.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1