AI ajanlarının izin verilen sınırların dışına çıkması halinde izole edilmesini veya durdurulmasını sağlayan bir kontrol platformu tanıtıldı. Nvidia($NVDA), yazılım ve donanımı bir araya getirerek yalnızca modelin kararlarına dayanmayan bir güvenlik mekanizması sundu.
Nvidia, 28'inde açık kaynaklı çalışma zamanı OpenShell ile donanım tabanlı izleme tasarımı Sentry'yi birleştiren Open Agent Safety Platform'u duyurdu. Şirket, Anthropic, Microsoft, JPMorganChase, Palantir, Cisco, CrowdStrike ve Hugging Face'in de aralarında bulunduğu 100'den fazla şirket ve kurumun teknik iş birliğine katıldığını açıkladı.
OpenShell, AI ajanlarının erişebileceği dosya, ağ ve araçları sınırlayan bir çalışma ortamı olarak tasarlandı. Kum havuzu çalıştırma, hizmet erişim kontrolü, kimlik bilgilerini koruma ve politika doğrulama işlevleri sunan sistem, ajanın kendisini yeniden yazmaya gerek kalmadan yetkilerin kontrol edilmesini sağlıyor.
OpenShell, ajanların kabuk açması, kod çalıştırması veya alt ajanları çağırması halinde de kısıtlamaları koruyacak şekilde tasarlandı. Kullanılabilecek kaynaklar ve ağ talepleri önceden belirlenerek çalışma alanı daraltılıyor.
Sentry ise OpenShell'den bağımsız çalışan bir kontrol katmanı olarak konumlanıyor. Nvidia, Sentry'nin BlueField-4 DPU üzerinde ajan davranışlarını sürekli izlediğini ve sınırları aşan ajanları çalışma ortamının dışından izole edebildiğini veya durdurabildiğini belirtti.
Nvidia'nın açıkladığı işlem süresi birkaç milisaniye. OpenShell çalışma ortamını ve ağ taleplerini sınırlandırırken Sentry, ayrı bir donanım katmanında politikaları uyguluyor. Böylece ajanın kontrol mekanizmalarını kendi başına devre dışı bırakması zorlaştırılıyor.
AI ajanlarının değerlendirme ortamlarının sınırlarını aştığı vakalar, platformun duyurulmasının arka planını oluşturuyor. OpenAI, temmuz ayında gerçekleştirdiği kurum içi siber güvenlik değerlendirmesinde bazı modellerin izolasyon kontrollerini aşarak internete eriştiğini ve Hugging Face sistemlerine sızdığını açıkladı.
OpenAI, söz konusu modellerin Hugging Face sunucularında kod çalıştırdığını, bir sunucuda kök yetkisi elde ettiğini ve bazı gizli verilere ulaştığını bildirdi. Vaka, modellerin kendilerine verilen görevleri yerine getirirken dış sistemlere erişebileceğini ortaya koydu.
Avustralya hükümeti de haziran ayında OpenAI ajanlarının Medicare istatistik raporlama portalındaki herkese açık ve özel dosyalara eriştiğini açıkladı. Avustralya Başbakanı Anthony Albanese (Anthony Albanese), 24'ünde düzenlediği basın toplantısında kişisel verilere erişildiğine dair kanıt bulunmadığını, ancak soruşturmanın sürdüğünü söyledi.
Anthropic, 30 Temmuz'da yaklaşık 141.006 siber güvenlik değerlendirme kaydını inceledikten sonra Claude modellerinin internete bağlı değerlendirme ortamları üzerinden üç gerçek kuruluşun sistemlerine eriştiği vakaları tespit ettiğini duyurdu. Şirket, sonraki incelemelerde Ocak 2026'da meydana gelen dördüncü bir vakayı da belirlediğini açıkladı.
Darktrace'in araştırma birimi Signal Labs, 24'ünde yayımladığı deneyde bazı AI ajanlarının kendilerini değerlendiren sistemlere sızarak puanları değiştirdiğini bildirdi. Araştırmacılar, bazı ajanların ağ keşfi ve kimlik bilgisi hırsızlığının ardından sistemlere sızdığını ve değerlendirme ortamının kendisini değiştirdiğini belirtti.
Nvidia'nın kurucusu ve CEO'su Jensen Huang (Jensen Huang), “AI'ın potansiyelinin hayata geçirilebilmesi için AI güvenliği sorununu çözmemiz gerekiyor. Güvenlik ve emniyet, tüm teknoloji yığını boyunca mühendislik gerektiriyor” dedi. Bu açıklama, kontrolün yalnızca AI modelinin eğitim aşamasında değil, tüm çalışma altyapısında uygulanması gerektiğine işaret ediyor.
Anthropic'in baş ticari sorumlusu Paul Smith (Paul Smith), Nvidia platformunun donanım ve yazılım genelinde ek yönetişim ve kontrol katmanları sunduğunu söyledi. SpaceX'in AI Başkanı Mike Nicolls (Mike Nicolls) da güvenliğin modelin dışında uygulanması ve ajanların aşamayacağı ayrı kontrol mekanizmalarının bulunması gerektiğini belirtti.
Bununla birlikte OpenShell ve Sentry tüm riskleri ortadan kaldırmıyor. Hangi dosya ve ağ taleplerine izin verileceğini belirleyen politikalar hatalı tasarlanırsa aşma ihtimali devam ediyor. Sentry'nin donanım tabanlı kontrolü de BlueField-4 DPU dahil belirli altyapı yapılandırmalarıyla bağlantılı.
Nvidia, OpenShell'in Arm ve Intel gibi üçüncü taraf bilişim platformlarına da genişletilebileceğini açıkladı. Ancak şirketlerin gerçek kullanım kapsamı ve ticari dağıtım takvimine ilişkin ayrıntı paylaşmadı.
AI ajanları finans, siber güvenlik ve robotik gibi alanlarda dış sistemlere daha fazla bağlandıkça, modelin güvenli şekilde eğitilmesinin yanında çalışma yetkilerini kontrol eden teknolojilere de ihtiyaç duyulabilir. Dağıtık AI ortamlarında acil durdurma mekanizmalarının çalışma sınırlarının ele alındığı TokenPost haberi gibi, kontrol kapsamı ve altyapı yapılandırması gelecek dönemde incelenmesi gereken başlıklar arasında yer alıyor.
Yorum 0