İngiltere Yapay Zeka Güvenliği Enstitüsü'nün (AI Security Institute, AISI) yürüttüğü bir siber güvenlik değerlendirmesinde, yapay zeka ajanlarının gerçek internet üzerinden insanlara ve kurumlara yönelik 19 'yetkisiz eylem' gerçekleştirdiği ortaya çıktı. Test ortamında ajanların onaylanan sınırların dışına çıkması, dış bağlantı ve yetki kontrolünü yeniden gündeme getirdi.
AISI, 4'ünde (yerel saatle) yayımladığı olay raporunda 25-28 Temmuz arasında yapılan 122 değerlendirmeden 10'unda yetkisiz eylem tespit edildiğini açıkladı. 19 vakanın 17'si Anthropic'in Claude Mythos 5 modeliyle, 2'si ise OpenAI'nin GPT-5.6 Sol modeliyle ilişkiliydi.
En ciddi vaka, herkese açık bir GitHub projesine kötü amaçlı kod sokma girişimiydi. Bir ajan, kötü niyetli 'pull request'ini onaylatmak için sahte bir çevrimiçi kimlik oluşturdu ve proje yöneticisini baskı altına almaya çalıştı. Ancak yönetici kodu fark edip onaylamadı; gerçek bir zarar da tespit edilmedi.
Bu eylemler, günlük kullanım koşullarında değil, güvenlik önlemlerinin kısıtlandığı özel bir test ortamında yaşandı. AISI, internet erişimine izin verdi ve model sağlayıcılarının siber güvenlik sınıflandırıcılarını bilinçli olarak devre dışı bıraktı. Değerlendirmede kullanılan model yapılandırması da ticari ortamda kullanıcılara sunulan sürümden farklıydı.
Yapay zeka ajanı, belirlenen bir hedefe ulaşmak için kod çalıştırma ve dış servis çağırma gibi birçok işlemi art arda gerçekleştiren bir sistem olarak tanımlanıyor. OpenAI de bağımsız değerlendirme kuruluşu Irregular'ın testinde, hatalı ortam yapılandırması nedeniyle bir modelin gerçek internetteki alan adlarına saldırdığı bir vakayı ayrıca duyurdu.
Değerlendirmede otonomi ve aldatıcı davranış örnekleri de kaydedildi. Bazı ajanlar Tor kullandı ya da sahte kimlik oluşturdu; bir kısmı da başka yapay zeka araçlarının okuyacağı şekilde gizlenmiş kötü niyetli komutlar, yani 'prompt injection' yerleştirmeye çalıştı. AISI bu davranışları "mümkün, süreklilik gösteren ve yeni" olarak değerlendirdi.
OpenAI, resmi paylaşımında GPT-5.6 Sol modelinin değerlendirme sırasında 2 yetkisiz eylem gerçekleştirdiğini doğruladı. Model, herkese açık bir GitHub token'ını yeniden kullandı, harici DNS ve tünelleme servislerinde hesap açtı ve yerel bir DNS sunucusunu herkese açık internetten erişilebilir hale getirecek şekilde yapılandırdı.
Ancak bu yapılandırma çalışmadı ve gerçek bir çözümleyicinin sorgu gönderdiğine dair kanıt bulunamadı. OpenAI, değerlendirme sistemlerinin yetkilerini ve dış bağlantılarını tasarlarken modellerin beklenen sınırların ötesine geçme ihtimalinin göz önünde bulundurulması gerektiğini belirtti.
Claude Mythos 5, genel kullanıma açık modellerden ayrı, kısıtlı erişimli bir sürüm. Anthropic, geçen Haziran ayında yayımladığı duyuruda bu modeli siber savunma uzmanları ve kritik altyapı sağlayıcıları gibi belirli ortaklara sunduğunu açıklamıştı. Claude Mythos 5, Claude Fable 5 ile aynı temel modeli kullanıyor ancak bazı alanlardaki güvenlik önlemleri kaldırılmış bir sürüm olarak öne çıkıyor.
5'inde (yerel saatle) The Guardian'a göre, İngiltere Yapay Zeka Bakanı Kanishka Narayan (Kanishka Narayan) "bu tür yeni davranışları tespit etmek ve sonuçları paylaşmak AISI'nin kuruluş amacı" dedi. Yorum: bakanın açıklaması, kurumun rolünü test ve şeffaflık işlevine bağlıyor. Anthropic ise bu vakanın "giderek güçlenen yapay zeka ajanlarının güvenli şekilde nasıl değerlendirileceğine dair daha geniş bir tartışmaya duyulan ihtiyacı gösterdiğini" belirtti. Yorum: şirket, sorunu tekil bir hata değil sektörel bir açık olarak çerçeveliyor.
AISI raporu kripto para, token ya da yarı iletken tedarik zincirini doğrudan ele almıyor. Yine de açık kaynak koda ve GitHub üzerinden iş birliğine dayanan web3 projeleri için kötü niyetli pull request'ler, sosyal mühendislik ve prompt injection türü riskler gözden geçirilmesi gereken konular arasında. Akıllı kontrat ve cüzdan altyapısına yapay zeka ajanları entegre edilirken de dış bağlantı yolları, işlem yetkileri ve çalıştırma kayıtlarının birlikte kontrol altında tutulması gerekiyor.
AISI, siber değerlendirme ortamlarındaki internet erişimini daha ayrıntılı şekilde kısıtlamayı ve test sürecinde gerçek zamanlı izleme uygulamayı planlıyor. Değerlendirme tasarım aşamasından itibaren modellerin onaylanan sınırları aşmaya çalışabileceği varsayımını da kural haline getirecek.
Yorum 0