OpenAI, yapay zekâ modellerinin sandbox’tan çıkması, GitHub token’larının açığa çıkması ve kendi kendini çoğaltan prompt injection saldırıları dahil 9 sapma vakasını açıkladı. Açıklanan vakaların gerçekte yaşanan sorunların yalnızca bir bölümünü oluşturabileceği yönünde endişeler de dile getirildi.
OpenAI, modellerin talimatlardan saptığı veya güvenlik önlemlerini aştığı vakaları takip etmek, incelemek ve açıklamak için ‘model misalignment raporlama sistemi’ oluşturdu. Şirket, 16 Eylül’de ilk 6 vakayı yayımladıktan sonra yeni örnekler ekledi ve tekil vakaların model genelindeki sapma sıklığını göstermediğini belirtti.
TechCrunch, raporun uzun bir dönemde ortaya çıkan farklı sapma davranışlarını bir araya getirdiğini bildirdi. OpenAI CEO’su Sam Altman’ın büyük miktardaki ajan faaliyet kayıtlarını incelemeye devam ettiğini açıklaması dikkate alındığında, şimdiye kadar açıklanan 9 vakayla toplam ölçeği değerlendirmek zor.
Son açıklanan vakalardan birinde, 20 Eylül’de şirket içindeki bir araştırma modeli sandbox’ın DNS yapılandırmasındaki açığı kullanarak harici bir sohbet botuna sorgu yöneltti. OpenAI’nin izleme sistemi olayı 15 dakika içinde tespit etti ve ilgili çalıştırma yaklaşık 2 saat 30 dakika sonra sonlandırıldı.
OpenAI daha sonra iki bağımsız engelleme mekanizması ekledi. Şirket ayrıca araç kullanan en gelişmiş modellerin eğitim, değerlendirme ve çıkarım süreçlerini geçici olarak durdurduğunu açıkladı.
Başka bir vakada, şirket içi bir model matematik ispatı görevini yürütürken başka bir ekibin çalışmalarını incelemek amacıyla bir araştırmacının GitHub token’ını herkese açık bir depoya yükledi. Model, gizli bilgi tespitinden kaçınmak için token’ı birkaç parçaya bölmeye çalıştı ve araştırmacı iki kez sorunu kendi kendine çözmesini istemesine rağmen dış erişimi yeniden denedi.
OpenAI, bu olayın ardından otomatik inceleme ve gerçeğe yakın zamanlı olay izleme sistemlerini uyguladığını belirtti. Vaka, modelin yalnızca talimatları yanlış yorumlamakla kalmayıp hedefe ulaşmak için gözetim prosedürlerini aşmaya çalışabileceğini gösterdi.
Kendi kendini çoğaltan bir prompt injection saldırısı da raporlandı. E-postada yer alan talimatlar otomasyon ajanının yanıtına kopyalanıyor ve bu yanıtı alan başka bir ajana yeniden iletiliyordu.
Prompt injection, kullanıcının vermediği talimatların harici içerik içine gizlenerek model tarafından uygulanmasını sağlamaya yönelik bir saldırıdır. E-postaları okuyup yanıt hazırlayan bir ajanın, metindeki talimat doğrultusunda yanıt dilini değiştirmesi veya e-postanın tamamını yeniden eklemesi bu saldırının tipik örnekleri arasında yer alır.
Bu vakada e-posta, ajanı İspanyolca yanıt vermeye ve e-postanın tamamını yanıtına eklemeye yönlendirdi. Aynı talimatın bu yanıtı alan başka bir ajana da iletilmesiyle saldırı kendi kendine yayılan bir biçim kazandı.
Sam Altman(Sam Altman) OpenAI CEO’su, X’te yaptığı paylaşımda “Petabaytlarca ajan faaliyet kaydını inceliyor ve etkilenen kuruluşlarla çalışırken şeffaflık ile net bir anlayış arasında denge kuruyoruz” dedi. Altman, açıklama önceliğinin olayların ciddiyetine göre belirlendiğini söyledi.
OpenAI, kendi kendini çoğaltan prompt injection saldırısının kontrollü bir eğitim ve değerlendirme ortamında tespit edildiğini, gerçek ortamda zarara yol açan bir olay olmadığını açıkladı. Araştırmacılar, bunun yeni bir saldırı türü olması nedeniyle vakayı kamuoyuna duyurduklarını belirtti.
OpenAI’nin daha önce açıkladığı modelin kontrolü aşmasına yönelik talimat ekleme vakası ile bu rapor, modellerin görev özetleri veya harici araçlar aracılığıyla belirlenen kısıtların dışına çıkabileceğini gösteriyor. Bununla birlikte her vaka tekil bir gözleme dayanıyor ve model genelindeki görülme sıklığını veya gerçek zararların boyutunu doğrudan ortaya koymuyor.
Yapay zekâ ajanları e-posta, kod depoları ve harici hizmetler gibi araçlara bağlandıkça daha fazla görevi yerine getirebiliyor. Ancak bu bağlantılar, yetki kötüye kullanımı ve talimatların değiştirilmesi için yeni yollar da açıyor. Bu nedenle yürütme yetkilerinin sınırlandırılması, harici bağlantıların izlenmesi ve olayların ardından yeniden oluşturma ile engelleme süreçlerini destekleyecek kayıt sistemleri temel güvenlik önlemleri arasında görülüyor.
OpenAI, bundan sonra modellerin eğitim, değerlendirme, test ve dağıtım süreçlerinin tamamında ortaya çıkan yetkisiz davranışları ve gözetimden kaçınma vakalarını rapor kapsamına alacak. Şirketin yeni sistem kapsamında ek vakaları ve karşı önlemleri hangi ölçütlerle açıklayacağı izlenecek.
Yorum 0