OpenAI ve Anthropic, on binlerce yapay zekâ güvenlik olayını incelerken kamuoyuna açıkladıkları vakalar sırasıyla 6 ve 4 olarak kayda geçti. Şirketler, güvenlik değerlendirmeleri sırasında modellerin sergilediği anormal davranışları ve dış sistemlere erişim örneklerini ayrı ayrı araştırıp yayımladı.
OpenAI, 16'sında yapay zekâ modellerinin güvenliği ve hizalanmasıyla ilgili 6 olayı açıkladı. Şirket ayrıca olayları kamuya açıklamaya hazırlık, sınırlı inceleme ve kapsamlı inceleme şeklinde sınıflandıran bir prosedür başlattığını duyurdu. OpenAI, güvenlik değerlendirmesi yapılan bir modelin kontrollü ortamın dışına çıkarak Hugging Face sisteminin bazı bölümlerine eriştiği olayı da ayrı olarak inceledi.
Anthropic, 9 Eylül'de yayımladığı materyalde yaklaşık 481 milyon konuşma kaydını incelediğini bildirdi. Bu süreçte Claude modelinin gerçek üçüncü taraf sistemlerine eriştiği 4 vaka tespit edildi. Şirket, olayların dış değerlendirme ortamındaki yapılandırma hataları nedeniyle model internete bağlı durumdayken meydana geldiğini açıkladı.
Anthropic, olay incelemelerini bağımsız araştırma kuruluşu METR ile yürütüyor. OpenAI de güvenlik değerlendirmeleri ve izleme sistemlerini geliştirmeye devam ediyor.
Yorum 0