Gelişmiş yapay zekâ modelleri kamuya sunulmadan önce devletin değerlendirme sürecine doğrudan katılması gerektiği yönünde bir öneri gündeme geldi. Modellerin aşmaması gereken risk seviyesinin yalnızca şirketlerin inisiyatifine bırakılmaması gerektiği belirtildi.
Microsoft(MSFT) Yapay Zekâ Birimi Başkanı Mustafa Suleyman(Mustafa Suleyman), 24'ünde Bloomberg bülteninde yayımlanan değerlendirmesinde, gelişmiş yapay zekâ modellerinin yetenekleri için net bir ‘kırmızı çizgi’ bulunması gerektiğini ve değerlendirme sisteminin yalnızca şirketlere bırakılamayacağını açıkladı. Ancak belirli teknik kriterler veya uygulama takvimi sunulmadı.
Öneri, yapay zekâ düzenlemelerinin model yayımlandıktan sonraki denetimden lansman öncesi değerlendirmeye genişletilmesi yönündeki tartışmalarla örtüşüyor. Devletin model kamuya açılmadan önce risk seviyesini incelemesi, geliştiricilerin kendi belirlediği güvenlik standartlarını tamamlayabilir.
Microsoft, ABD Yapay Zekâ Standartları ve İnovasyon Merkezi(CAISI) ile Birleşik Krallık Yapay Zekâ Güvenliği Enstitüsü(AISI) üzerinden öncü modellerin güvenliğini ve yüksek riskli yeteneklerini incelemeye yönelik iş birliği çerçevelerini daha önce duyurdu. Bu iki iş birliği, devletin model lansmanını önceden onaylamasını öngören bir sistemden farklı.
Microsoft, mayısta yayımladığı materyalde ABD Ulusal Standartlar ve Teknoloji Enstitüsü(NIST) ile düşmanca değerlendirme metodolojileri geliştirdiğini açıkladı. Düşmanca değerlendirme, yapay zekâ modellerinin beklenmedik davranışlarını, kötüye kullanım yollarını ve başarısızlık ihtimallerini kasıtlı olarak test etme yöntemini ifade ediyor.
Değerlendirmelerin tekrarlanabilirliğini artırmak için ortak bir çerçeve, veri setleri ve çalışma prosedürleri de geliştirilecek. Amaç, aynı modelin benzer koşullarda test edilmesini ve sonuçların karşılaştırılabilmesini sağlayacak standart bir değerlendirme yöntemi oluşturmak.
Birleşik Krallık AISI ile yürütülen iş birliği, yüksek riskli yetenekler ile güvenlik önlemlerinin etkinliğini doğrulamaya odaklanıyor. İş birliğinin kapsamına, etkileşimli yapay zekânın hassas durumlarda kullanıcılarla nasıl etkileşime girdiğini inceleyen toplumsal dayanıklılık araştırmaları da dahil edildi.
CAISI, ticari yapay zekâ sistemlerinin test edilmesi ve ortak araştırmalar yürütülmesi için ABD hükümeti içindeki temas noktası olarak faaliyet gösteriyor. Merkez, mayısta Çin menşeli DeepSeek V4 Pro yapay zekâ modelinin siber güvenlik, yazılım mühendisliği, doğa bilimleri, soyut akıl yürütme ve matematik alanlarındaki değerlendirme sonuçlarını yayımladı.
Birleşik Krallık AISI de öncü modelleri siber güvenlik, biyoloji, kimya, özerklik ve güvenlik önlemleri alanlarında değerlendiriyor. Enstitü, bazı yapay zekâ yeteneklerinin yaklaşık her sekiz ayda bir iki katına çıktığını belirtirken, kontrollü test sonuçlarının gerçek kullanım ortamındaki performans ve riskleri bütünüyle yansıtmayabileceğini açıkladı.
Microsoft’un öncü yönetişim çerçevesi; yüksek riskli yeteneklerin değerlendirilmesi, dış doğrulama, model risklerinin sınıflandırılması ve değerlendirme bilgilerinin paylaşılması ilkelerini içeriyor. Ticari açıdan hassas veya kötüye kullanılabilecek bilgilerin paylaşım kapsamı sınırlandırılabilir.
Devlet değerlendirmesinin etkin biçimde uygulanabilmesi için değerlendirme kurumlarının bağımsızlığı ve şirketlerin iç verilerine erişim hakkının birlikte güvence altına alınması gerekiyor. Değerlendirme sonuçlarının hangi ölçüde açıklanacağı da model geliştiricileri ile devlet arasında koordine edilmesi gereken bir konu olarak öne çıkıyor.
Şirket içi değerlendirmelerle dış değerlendirmelerin birleştirildiği modeller de tartışılıyor. TokenPost, daha önce Anthropic’in yapay zekâ değerlendirme kurumunu şirket içinde konumlandırmaya yönelik iş birliğini aktarmıştı. O dönemde de değerlendiricilerin erişim kapsamı ve mali bağımsızlığı temel tartışma başlıkları arasında yer almıştı.
Çevrim içi tartışmalarda devlet denetiminin güçlendirilmesi gerektiğini savunan görüşlerin yanı sıra, büyük şirketlerin düzenlemeleri küçük rakiplerin pazara girişini zorlaştırmak için kullanabileceği yönünde endişeler de dile getirildi. Ancak bunlar bazı çevrim içi kullanıcıların tepkileriyle sınırlı olduğundan sektörün tamamının görüşü olarak değerlendirilemez.
Değerlendirme kriterleri ve bilgilerin paylaşım kapsamı, Türkiye'deki yapay zekâ şirketleri ve kullanıcılar için de model benimseme sürecinde incelenmesi gereken unsurlar arasında yer alabilir. Bununla birlikte, söz konusu önerinin Türkiye'deki düzenlemelere veya yerel şirketlerin lansman prosedürlerine doğrudan uygulanacağına ilişkin bir açıklama yapılmadı.
Suleyman’ın açıklamasının gerçek bir düzenleme girişimine dönüşüp dönüşmeyeceği ve devlet değerlendirmesinin yapay zekâ modelleri için zorunlu bir lansman prosedürü haline gelip gelmeyeceği henüz netleşmedi. Önümüzdeki dönemde ‘kırmızı çizgi’nin teknik tanımı, değerlendirme sonuçlarının hukuki bağlayıcılığı ve bilgilerin paylaşım kapsamının tartışılması bekleniyor.
Yorum 0