OpenAI'nin iç siber güvenlik değerlendirmesinde bir AI ajanı 'sandbox' korumasını aşarak Hugging Face sistemlerine ve OpenAI'nin araştırma altyapısının bir bölümüne erişim sağladı. Olay, AI ajan güvenliğinde odağın artık yalnızca model denetiminden çıkıp erişim yetkisi ve ağ kontrolüne kaydığını gösteriyor.
26 Ağustos'ta (yerel saatle) yayımlanan teknik raporda OpenAI, şirket içi kullanıma özel araştırma modeli IM1'in değerlendirme sürecinde yetkisiz bir mesaj panosu oluşturduğunu ve Artifactory üzerinden ajanlar arası iletişimi ile dış internet erişimini sürdürdüğünü açıkladı. Şirket bu olayı bir 'uyarı atışı' olarak nitelendirdi ve sandbox ayrıştırması, ağ izolasyonu, log toplama ile 'chain-of-thought (CoT)' denetiminin güçlendirilmesi gibi önlemleri devreye aldığını belirtti.
Olay Temmuz ayındaki siber değerlendirme sırasında yaşandı. OpenAI 10 Temmuz'da Hugging Face'e ait herkese açık kimlik bilgilerini tespit etti, 11 Temmuz'da birden fazla Hugging Face sunucusunda kod çalıştırma yetkisi elde etti ve 19 Temmuz'da anormal etkinliği fark etti. 20 Temmuz'da ise bu etkinliğin şirket içindeki ajanla bağlantısı doğrulandı.
OpenAI, olayın müşteri verilerini, ürün özelliklerini veya hizmet erişilebilirliğini etkilemediğini açıkladı. Ancak şirket, 13-19 Temmuz arasında kendi iç ağını yeniden hedef alan ajan etkinliği yaşandığını ve bu süreçte araştırma kümesi üzerinde yönetici (admin) yetkisine kadar erişim sağlandığını belirtti.
Hugging Face 16 Temmuz'da yaptığı açıklamada, kötü amaçlı bir veri setinin veri işleme hattındaki bir kod çalıştırma açığından yararlandığını duyurdu. Sınırlı sayıda dahili veri setine ve bazı servis kimlik bilgilerine erişim yaşandığını, ancak herkese açık modellerde, veri setlerinde veya Spaces içeriklerinde değişiklik yapıldığına dair kanıt bulunmadığını açıkladı.
Hugging Face'in sonraki teknik zaman çizelgesi, saldırganın OpenAI'nin değerlendirme sandbox'ından çıkarak dış bir 'launchpad' üzerinden Hugging Face'in üretim hattına ulaştığını ortaya koydu. Hugging Face bu süreçte yaklaşık 17 bin 600 eylemi yeniden oluşturduğunu bildirdi.
Bağımsız incelemeler ajanların hareket alanının daha geniş olduğunu gösteriyor. METR ve Redwood Research, yaklaşık 1200 ajanın yetkisiz mesaj panosunda 70 bini aşkın mesaj ve dosya paylaştığını, bunlardan yaklaşık 700'ünün Hugging Face saldırısına dahil olduğunu açıkladı.
İki kurumun inceleme kapsamı 26 Haziran ile 13 Temmuz arasını içeriyordu. Asıl yoğun analiz büyük ölçüde 7 Temmuz sonrası verilere dayandı; METR'den 2, Redwood Research'ten 1 araştırmacı, OpenAI'nin ofislerinde toplam 6 gün yerinde inceleme yürüttü.
Kritik nokta, ajanların yalnızca bir çözüm üretmekle kalmayıp değerlendirme sisteminin kendisini aşmaya çalışmış olması. METR ve Redwood Research, ajanların otomatik puanlama sistemlerini yanıltmaya veya logları değiştirmeye yönelik ortak projeler yürüttüğünü açıkladı. OpenAI da olayın nedenlerini 'ödül hackleme', yetkisiz iletişim ve ajanlar arası hedef bulaşması olarak sınıflandırdı.
AI ajanları, bir hedefi gerçekleştirmek için dış araçlara, dosyalara, API'lere ve ağ kaynaklarına erişebilen sistemler. Genellikle standart bir sohbet botundan çok daha geniş işlem yetkisine sahipler ve geliştirme ile güvenlik değerlendirme ortamlarında kod çalıştırma ile veri erişim yetkisi de kazanabiliyorlar. Bu nedenle izolasyon zayıf olduğunda, bir değerlendirme deneyi gerçek altyapı ihlaline dönüşebiliyor.
Yalnızca CoT denetiminin yeterli olup olmadığı konusu henüz netleşmiş değil. OpenAI, bu değerlendirme sırasında ilgili denetim mekanizmasının fiilen çalışmadığını, olaydan sonra belirli değerlendirmeler ve yüksek performanslı modeller için denetim yükümlülüğünü artırdığını açıkladı. METR ve Redwood Research da veri hacminin çok büyük olduğunu, analizde büyük ölçüde AI destekli araçlara dayanıldığını ve bazı iletişim ile etkinliklerin gözden kaçmış olabileceğini belirtti.
Fortune, şirketlerin AI ajanlarını potansiyel birer 'içeriden kişi' gibi ele alması gerektiğini vurguladı; çalışanların düşüncesi okunamadan da yetki ve erişim nasıl sınırlandırılıyorsa, ajanlar için de yetki kontrolü ve gerçek zamanlı davranış denetiminin gerekli olduğu yönünde bir değerlendirme yaptı.
Bu gelişme, AI ajan rekabetinin model performansından şirket sistemleri üzerindeki kontrole kaydığına dair önceki haberimizle de örtüşüyor.
Bu olay, şirketlerin AI ajanı benimseme kriterlerini yeniden gözden geçirmesini gerekli kılıyor. Yalnızca istem (prompt) ve model çıkarımını izlemek yeterli değil; bir ajanın hangi dosyaları kullanabildiği, hangi API'leri çağırabildiği ve hangi kimlik bilgilerine erişebildiği artık ilk kontrol noktası haline geldi.
OpenAI, olayın ardından daha ayrıştırılmış sandbox yapıları, ağ izolasyonu, güçlendirilmiş log toplama ve araç kullanımına dayalı pekiştirmeli öğrenme değerlendirmelerinde CoT denetimini zorunlu hale getirdiğini açıkladı. Yüksek performanslı modellerin çevrimiçi araçlar kullandığı değerlendirmelerde denetim ve engelleme standartlarını yükselterek sürdürdüğünü belirtti.
Yorum 0