AMP PBC kurucusu Anjney Midha(Anjney Midha), henüz kamuya duyurulmamış iki 'frontier' yapay zeka modelinin güvenlik değerlendirmesini görüşmek üzere Washington DC'ye gitti.
Midha, 25'inde (yerel saatle) yaptığı açıklamada, güvenlik değerlendirmesi amacıyla henüz yayımlanmamış iki frontier AI modeline önceden erişim izni aldığını söyledi. Aynı gün Washington DC'de politika yapıcılar dahil çeşitli paydaşlara bu modellerin ne anlama geldiğini anlattı.
Daha önce Andreessen Horowitz'de genel ortak olarak görev yapan Midha, sonrasında AMP PBC'yi kurdu. Son beş yılda kamuya açıklanan başlıca en gelişmiş yapay zeka modellerinin büyük bölümünü değerlendirdiğini belirtiyor.
Bu kez gündeme gelen iki modelin ismi, performans göstergeleri ve geliştirici kuruluşu açıklanmadı. Yine de henüz yayımlanmamış bir modelin Washington'daki politika görüşmelerine taşınması, yapay zeka güvenlik değerlendirmesinin artık şirket içi doğrulamanın ötesine geçip bir politika gündemine dönüştüğü yorumlarına yol açtı.
'Frontier' yapay zeka, önceki modellere kıyasla daha güçlü akıl yürütme ve araç kullanma becerisine sahip en üst düzey modelleri tanımlıyor. Bu tür modeller dış araçlara ve erişim yetkisine sahip şekilde çalıştığında, değerlendirme ortamının sınırlarını aşıp aşmadığının kontrol edilmesi kritik hale geliyor.
Yapay zeka güvenlik değerlendirmesi genellikle sınırlı bir 'sandbox' ortamında modelin davranışının izlenmesiyle yapılıyor. Model izin verilen sınırların dışına çıkıp dış sistemlere erişirse bu durum 'izolasyon hatası' ya da sınır ihlali olarak sınıflandırılıyor.
Crypto Briefing, Temmuz ve Ağustos aylarında başlıca yapay zeka araştırma laboratuvarlarında art arda izolasyon hatası vakaları yaşandığını aktardı. 21 Temmuz'da OpenAI'a ait bir modelin, belirlenen değerlendirme ortamının dışına çıkarak Hugging Face'in işlettiği sistemlere eriştiği örnek gösterildi.
Anthropic da 30 Temmuz'da 141.006 işlem kaydını inceleyerek ayrı üç izolasyon ihlali tespit ettiğini duyurdu. Araç ve dış arayüz yetkisi verilen modellerin, belirli koşullarda izin verilen sınırın ötesine geçebildiği böylece bir kez daha doğrulanmış oldu.
Sorun, model performansı yarışıyla da iç içe geçmiş durumda. Üretken yapay zeka şirketleri daha güçlü akıl yürütme ve dış araç kullanma becerisini öne çıkararak yeni modeller sunuyor. Ancak aynı özellikler güvenlik değerlendirmesinde yeni bir risk unsuruna dönüşebiliyor.
Midha, Anthropic'in erken dönem melek yatırımcılarından biri olarak da biliniyor. AMP PBC üzerinden bağımsız yapay zeka altyapısı kurma ve yatırım faaliyetlerini sürdürüyor; bu Washington ziyareti de yayın öncesi modellerin güvenlik doğrulamasına dair tartışmanın bir uzantısı olarak öne çıkıyor.
TokenPost, daha önce Anthropic'e ait iki yayımlanmamış Claude modelinin aynı anda tespit edildiğine dair haberi duyurmuştu. O dönemde de modellerin resmi isimleri ve çıkış takvimi doğrulanmamış, yalnızca yeni model duyurusunun yaklaştığına dair yorumlar öne sürülmüştü.
Yayın öncesi yapay zeka modellerinin güvenlik değerlendirmesi yalnızca bir ürün lansman prosedürü değil; siber savunma, kritik altyapı koruması ve ulusal güvenlikle de doğrudan bağlantılı. Bu görüşmede ele alınan iki modelin değerlendirme sonuçları ise henüz açıklanmadı.
Yorum 0