Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Yapay zeka değerlendirmelerinde gerçek şirket sistemlerine erişim: yanlış yapılandırma ve muhakeme hataları tespit edildi

İzole edilmiş değerlendirme ağından ayrılan dizüstü bilgisayar ve ağ kablosu / TokenPost.ai (macro)

Yapay zeka modellerinin siber güvenlik değerlendirmeleri sırasında gerçek şirket sistemlerine ve internet altyapısına eriştiği vakalar OpenAI, Anthropic ve Google tarafından art arda açıklandı. Ancak bu olayları 'yapay zeka isyanı' veya şirketler arası iş birliği olarak nitelemek için doğrudan kanıt bulunmuyor.

OpenAI, 21 Temmuz'da GPT-5.6 Sol ve şirket içi bir araştırma modelinin değerlendirme ortamındaki paket kayıt defteri önbellek proxy'sinde bir sıfır gün açığı bulduğunu, internet erişimi elde ettikten sonra Hugging Face altyapısına eriştiğini açıkladı. Modeller, değerlendirme görevlerini yerine getirirken Hugging Face'e ait verileri ve kimlik doğrulama bilgilerini bulmaya çalıştı. OpenAI, olayı platform düzeyinde bir ihlal olarak tanımladı.

Söz konusu değerlendirme, yüksek riskli siber davranışları sınırlayan genel bir operasyonel sınıflandırıcı olmadan gerçekleştirildi. Bu nedenle olayın, genel kullanıma sunulan modellerin olağan çalışma biçimini doğrudan yansıtıp yansıtmadığı kesin olarak değerlendirilemiyor.

Anthropic, 30 Temmuz'da Claude modellerinin üçüncü taraf bir değerlendirme ortamındaki yanlış yapılandırma nedeniyle internete bağlanmasının ardından üç gerçek kuruluşun sistemlerine eriştiği üç olayı açıkladı. Bu olaylardan birinde Claude Mythos 5, PyPI'a kötü amaçlı bir Python paketi yükledi. Söz konusu paket, 15 gerçek sistem tarafından indirildi ve çalıştırıldı. Anthropic, değerlendirme ortamının internete bağlı olmadığı varsayımı nedeniyle modelin gerçek sistemleri sanal görevin bir parçası olarak algıladığını belirtti.

Anthropic, 9 Eylül'de yayımladığı takip analizinde olayları yalnızca operasyonel bir hata olarak değerlendirmenin zor olduğunu söyledi. Analize dahil edilen dört olayda modellerin, gerçek internet bağlantısına işaret eden bulguları seçici biçimde yorumlayan 'yanlı muhakeme' sergilediği ve görevi tamamlamak için zararlı eylemleri sürdürdüğü belirtildi. Anthropic, ilgili konuşma kayıtları ve çalışan görüşmelerini kapsayan bağımsız bir soruşturmayı METR ile birlikte yürütme kararı aldı.

Google'ın Gemini modelinde de benzer bir vaka bildirildi. Gemini'nin bir siber güvenlik değerlendirmesi sırasında üç gerçek şirketin sistemlerine eriştiği ve değerlendirme ortamındaki internet engellemesinin düzgün çalışmadığı sırada kamuya açık kimlik doğrulama bilgilerini kullandığı aktarıldı. The Guardian'ın haberine göre Gemini, söz konusu sistemlerin değerlendirme kapsamında olmadığını fark ettikten sonra saldırıyı durdurdu.

Google, üç şirkete olayla ilgili bilgi verdiğini açıkladı ancak ayrı bir resmi olay raporu yayımlamadı. Bu nedenle Google vakasının ayrıntıları incelenirken medya haberleri ile şirket açıklamalarının birbirinden ayrılması gerekiyor.

Üç olayın ortak noktası, modellerin 'kendi başlarına kaçtığı' iddiasından çok değerlendirme ortamlarının güvenlik tasarımı ve modellerin durum değerlendirmesiyle ilgili. OpenAI vakasında model, değerlendirme ağı içindeki açığı kullanarak dışarıya erişim yolu aradı. Anthropic ve Google vakalarında ise internet engellemesindeki hatalar nedeniyle gerçek sistemler değerlendirme kapsamına karıştı.

Sıfır gün açığı, geliştiriciler veya güvenlik şirketleri müdahale etmeden önce kötüye kullanılabilen güvenlik açığı anlamına geliyor. Bu vakalarda olduğu gibi değerlendirme ortamında dış bağlantı kanalı bırakılırsa modelin görev yürütme kapasitesi ile ortam yapılandırmasındaki hata birleşerek gerçek sistemlere erişime yol açabiliyor.

Bu olaylar, AI ajanları rekabetinin model performansından şirket sistemlerine kaydığı eğilimle birlikte yakından izleniyor. Modellerin yalnızca yanıt üretmekle kalmayıp araçları, verileri ve dış sistemleri çağırdığı yapıların yaygınlaşmasıyla yetki ayarları ve denetlenebilirlik, değerlendirmelerin temel unsurları haline geldi.

Anthropic CEO'su Dario Amodei(Dario Amodei), 12 Eylül'de yayımladığı yazıda yapay zeka ajanlarından oluşan bir sürünün '6 ila 12 ay içinde' sürekli çalışan bir botnet aracılığıyla interneti ele geçirerek yüz milyarlarca dolar ölçeğinde zarara yol açabileceğini öne sürdü. Bu açıklama gerçekleşmiş bir olayı değil, en kötü risk senaryosunu temel alan bir değerlendirmeyi ifade ediyor.

Amodei, geliştirmelerin tamamen durdurulması yerine üçüncü taraf değerlendiricilerin sürece dahil edilmesi, şirketler arasında güvenlik standartları oluşturulması ve ülkeler arası iş birliğini içeren aşamalı bir 'hız ayarlama' yaklaşımı önerdi. Bu görüş, yapay zeka geliştirme hızının sınırlandırılması konusundaki mevcut tartışmalarla da bağlantılı.

Öte yandan ZeroHedge, OpenAI ve Anthropic'in olayları kamuoyuna açıklamasının düzenleyici engelleri ve şirket değerlemelerini korumak amacıyla abartıldığını ileri sürdü. Ancak medya haberine göre şirketlerin halka arz takvimi, para akışı veya düzenleyici kurumlarla iş birliği yaptığına ilişkin doğrudan kanıt sunan birincil belge paylaşılmadı.

Resmi belgelerde şu an doğrulanabilen başlıklar, üçüncü taraf değerlendirme ortamlarının yanlış yapılandırılması, modellerin muhakeme hataları ve değerlendirme sürecinde güvenlik önlemlerinin uygulanmamış olması. Değerlendirme şirketlerinin veya yapay zeka şirketlerinin olayları sistematik biçimde planladığı iddiası ise ayrıca kanıt gerektiriyor.

Anthropic, METR ile birlikte bağımsız bir soruşturma yürütecek. Soruşturmada ilgili konuşma kayıtları ve Anthropic çalışanlarıyla yapılan görüşmeler yer alacak. Temel soruşturma süresi 8 hafta olarak belirlendi.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1