OpenAI, yapay zekâ (AI) ajanlarının kötü amaçlı istemleri e-posta, dosya ve kodlara yeniden ekleyerek diğer ajanlara yaydığı 'kendini kopyalayan istem enjeksiyonu' saldırısını deney ortamında tespit etti.
OpenAI, 25 Eylül'de yayımladığı resmi raporda, GPT-Red yaklaşımına dayalı bir iç model kullanarak bu saldırı türünü keşfettiğini açıkladı. İlk keşif 27 Haziran'da yapıldı ve deney, değerlendirme amacıyla simüle edilen araç çağrısı ortamında gerçekleştirildi.
İstem enjeksiyonu, e-posta veya web sayfası gibi AI'ın okuduğu dış içeriklere kötü amaçlı talimatlar gizleyerek modelin davranışını değiştiren bir saldırı türü. Kendini kopyalayan saldırı ise modelin aynı talimatı yanıt, dosya veya kod gibi çıktılara yeniden eklemesini sağladığı için bunun daha gelişmiş bir biçimi olarak değerlendiriliyor.
OpenAI tarafından paylaşılan örnekte kötü amaçlı talimat e-posta gövdesine yerleştirildi. AI ajanı, yanıtın sonuna kaynak e-postanın tamamını tekrar ekledi. Böylece bu yanıtı okuyan başka bir ajanın da aynı talimata maruz kalabileceği bir yapı oluştu.
Saldırının yayılma yolu e-postayla sınırlı kalmadı. Dosya sistemi ve kod yorumları üzerinden saldırı talimatlarının kopyalandığı örnekler de tespit edildi. Olasılık, özellikle e-posta ve takvim gibi dış bağlantı özelliklerini kullanan ortamlarda test edildi.
Saldırı yöntemleri arasında sahte düşünce süreçleri veya sahte araç mesajlarıyla modeli kandırma da yer aldı. Talimatların birden fazla mesaj üzerinden aktarıldığı 'çok atlamalı' saldırılar da araştırma kapsamına alındı.
Bu araştırmada kullanılan saldırı modeli ve savunmasız model, GPT-5.4-mini tabanlı iç araştırma kontrol noktalarıydı. OpenAI, bu modellerin kamuya sunulan ürünler olmadığını ve deneylerin simüle edilmiş araç çağrıları içinde gerçekleştirildiğini belirtti.
Bu kavram daha önce akademik çevrelerde de gündeme gelmişti. Araştırmacılar, 2024 tarihli 'Here Comes the AI Worm' başlıklı makalede, üretken AI e-posta asistanları arasında kötü amaçlı istemlerin zincirleme aktarılmasını öngören 'Morris II'yi ortaya koydu.
Morris II araştırmasında, e-posta asistanı AI sistemlerinin kötü amaçlı talimatları yanıtlara ekleyerek başka AI sistemlerine yayabilip yayamayacağı test edildi. OpenAI'ın açıklaması, önde gelen bir AI geliştiricisinin iç modeller üzerinde otomatik doğrulama yürütmesi bakımından farklılık gösteriyor.
OpenAI, GPT-Red'i otomatik bir red-team modeli olarak kullanıyor. GPT-Red, e-posta, web sayfası, yerel dosya ve araç çıktısına yerleştirilen saldırıları tespit ederek AI ajanlarının güvenlik açıklarını inceliyor.
OpenAI, kendini kopyalayan saldırıları GPT-Red'in eğitim hedeflerine dahil ederek savunma kapasitesini artırmayı planlıyor. Şirket, istem enjeksiyonlarına karşı yalnızca model eğitiminin yeterli olmadığını belirterek izleme, sandbox kullanımı, en az ayrıcalık ilkesi ve kritik işlemlerden önce kullanıcı onayının birlikte uygulanması gerektiğini açıkladı.
Bu örnek, AI modelinin kendisinin ağırlıkları veya hesaplama kaynaklarını kopyaladığı anlamına gelmiyor. Anlamı, AI'ın okuduğu ve ürettiği metinlerle dosyalara kötü amaçlı talimatların tekrar tekrar eklenerek sonraki ajana aktarılabilmesi.
Bu nedenle güvenlik kapsamı modelin içinden e-posta, belge, kod depoları ve takvim gibi bağlantılı sistemlere genişliyor. TokenPost'un AI ajanlarının yayılmasıyla şirketlerin yetki ve denetim kontrol sistemleri kurduğuna ilişkin haberi de aynı değişime odaklanmıştı.
Sosyal medyada bu örneği 'kendini kopyalayan AI' olarak adlandırmanın gerçek araştırma kapsamını olduğundan geniş gösterebileceği yönünde görüşler paylaşıldı. Bazı Reddit kullanıcıları da model ağırlıkları veya hesaplama kaynaklarının kopyalandığı bir olaydan değil, kötü amaçlı talimatların çıktılara yeniden eklenmesiyle gerçekleşen bir saldırıdan söz edilmesi gerektiğini savundu.
Şu ana kadar açıklanan bilgiler, kendini kopyalayan istem enjeksiyonunun deney ortamında mümkün olduğunu gösteriyor. Saldırının gerçek hizmetlerde yayıldığına veya kullanıcı verilerinin ele geçirildiğine dair bir kanıt açıklanmadı. OpenAI, ilgili saldırıları GPT-Red'in eğitimine dahil etmeyi planlıyor.
Yorum 0