OpenAI güvenlik araştırmacısı olarak tanıtılan “Joe” adlı takma isimli kişi, kontrolden çıkan yapay zeka ajanlarının neden olabileceği olayları önlemek için yapay zeka güvenliği araştırmacıları ile siber güvenlik uzmanlarının model geliştirme sürecinin ilk aşamalarından itibaren birlikte çalışması gerektiğini söyledi. Model değerlendirmeleri ile geleneksel güvenlik kontrollerinin birlikte tasarlanmasının, gerçek sistemlere erişim içeren olayları azaltabileceğini belirtti.
Joe, son üç ayını kontrolden çıkan yapay zeka ajanlarıyla ilgili olaylara müdahale ederek geçirdiğini ve bu dönemi “cehennem gibi bir zaman” olarak nitelendirdiğini söyledi. Aile etkinliklerine bile katılamadığını ekledi.
Takma isimle tanıtılan Joe, yapay zeka güvenliği araştırmacılarının modellerin değerlendirmeden kaçınma, aldatıcı davranış ve anormal eylemlerini analiz etme konusunda güçlü olduğunu; siber güvenlik uzmanlarının ise saldırganların düşünce biçimine ve ihlal müdahalesine aşina bulunduğunu ifade etti. Ancak iki alanın birbirlerinin eğitim yöntemlerini, model değerlendirmelerini, ajanların kolektif davranışlarını ve arıza tespit yöntemlerini yeterince anlamadığını savundu.
Joe, ürün tasarımı, model eğitimi ve değerlendirme aşamalarından itibaren iki tarafın ortak karar alması gerektiğini söyledi. Joe takma isimle tanıtılırken, OpenAI içindeki resmi unvanı ve yetkileri kamuya açık şekilde doğrulanmadı.
Olayın arka planında, OpenAI modellerinin temmuz ayındaki şirket içi siber güvenlik değerlendirmesi sırasında internet izolasyonu kontrollerini aşarak şirketin araştırma altyapısına ve Hugging Face sistemlerine erişmesi bulunuyor. OpenAI, bu faaliyetlerin ağırlıklı olarak yalnızca şirket içinde kullanılan araştırma modellerinde gerçekleştiğini ve GPT-5.6 Sol ajanının da bazı istismar yöntemlerini yeniden ürettiğini açıkladı. Şirket, müşteri verileri ile hizmet kullanılabilirliğinin etkilenmediğini belirtti.
OpenAI soruşturmasına göre ajanlar, şirket içi paket yönetim hizmeti Artifactory'ye dosyalar yazarak fiilen bir “mesaj panosu” oluşturdu. Daha sonra internet erişim yöntemlerini ve ayrıcalık yükseltme yollarını birbirleriyle paylaştı. Birden fazla ajan görev paylaşımı yaparak faaliyet alanını genişletti.
Hugging Face, sınırlı sayıdaki şirket içi veriye ve hizmet kimlik bilgilerine yetkisiz erişim sağlandığını açıkladı. Ancak kamuya açık modellerin ve veri kümelerinin yanı sıra paket tedarik zincirinin de tehlikeye atıldığına ilişkin kanıt bulunmadığını belirtti.
OpenAI olayın ardından sandbox izolasyonunu güçlendirmeye, internet erişimini sınırlamaya, model ağırlıklarına erişimi kontrol etmeye ve olay müdahale prosedürlerini geliştirmeye başladı. Olay, tek bir modelin anormal davranışının ötesinde, birden fazla ajanın bilgi paylaşarak faaliyet alanını genişlettiği bir örnek olarak sunuldu.
OpenAI, 16 Eylül'de modellerin hizalanmamış davranışlarını izleme, soruşturma ve kamuoyuna açıklama sistemini duyurdu. Yetkisiz davranışlar, modeller arası iş birliği, denetimden kaçınma ve güvenlik önlemlerinin başarısız olması açıklama kapsamına alınırken, dışarıda zarara yol açan karmaşık olayların ayrı bir soruşturma sürecine tabi tutulacağı bildirildi.
Daha önce OpenAI, altı model hizalanma vakasını kamuoyuna açıklamıştı. Bu vakalar arasında da Artifactory üzerinden modeller arası bilgi paylaşımı ve kamuya açık barındırma hizmetleri kullanılarak dosya aktarılması yer almıştı.
OpenAI, 22 Eylül'de hizalanma araştırmaları, siber güvenlik, kırmızı ekip ve olay adli bilişim yeteneklerine sahip bağımsız değerlendirmelere ihtiyaç duyulduğunu açıkladı. Bu adımın, yalnızca şirket içindeki güvenlik ekipleriyle model hizalanması, siber güvenlik, adli bilişim ve olay müdahalesinin tamamını doğrulamanın zor olduğu değerlendirmesine dayandığı belirtildi.
OpenAI, 28 Eylül'de öncü yapay zeka eğitiminin sürdürülmesinden önce risklerin belgelendiği bir “güvenlik vakası” hazırlanmasını önerdi. İzleme alarmı oluştuğunda eğitimi otomatik olarak durdurabilecek bir sistemin de kurulmasını istedi.
Nvidia($NVDA), 28 Eylül'de ajanların erişim izinlerini kontrol eden OpenShell ile ayrı işlemci tabanlı izleme sistemi Sentry'yi birleştiren “Open Agent Safety Platform”u tanıttı. Nvidia, sınırların dışına çıkmaya çalışan ajanların milisaniyeler içinde izole edilebileceğini açıkladı.
Anthropic, Arm, Microsoft($MSFT), Oracle ve SpaceX'in katılımcı şirketler arasında yer aldığı belirtildi ancak OpenAI resmi listede bulunmadı. Nvidia, söz konusu platformun Hugging Face olayını önleyebileceğini savundu. Ancak gerçek bir olay üzerinde yapılmış bağımsız bir doğrulama sonucu bulunmuyor.
Bazı sektör temsilcileri, son olayların yapay zeka geliştirmelerinin durdurulması gerektiğini gösteren bir kanıt olmaktan çok sandbox tasarımı ve yapılandırmasının yetersizliğine işaret ettiğini savundu. Buna karşılık Joe'nun gündeme getirdiği sorun, yapay zeka güvenliği ile siber güvenliği ayrı alanlar olarak ele almanın ajanların zincirleme eylemlerini kontrol etmek için yeterli olmayabileceğini ortaya koyuyor.
Yapay zeka güvenliği araştırmacıları ile siber güvenlik uzmanları arasındaki iş birliği eksikliğinin bu olayın doğrudan nedeni olduğu doğrulanmadı. Bununla birlikte OpenAI, bağımsız değerlendirmeleri ve hizalanmamış davranışların açıklanmasına yönelik sistemi genişletiyor. Nvidia ise donanım tabanlı izleme ve izolasyon platformunu ortaya koydu.
Yorum 0