Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

OpenAI, öncü pekiştirmeli öğrenme öncesi ‘güvenlik argümanı’ belgelendirmesi önerdi

Güvenlik argümanı belgesi ve eğitim durdurma anahtarı / TokenPost.ai

OpenAI, öncü yapay zekâ (AI) pekiştirmeli öğrenme eğitimine başlamadan önce yapılandırılmış güvenlik belgeleri hazırlanmasını öngören bir ‘güvenlik argümanı’ sistemi sundu. Sistem, eğitim sürecindeki risklerin gerekçeleriyle açıklanmasına ve sorun yaşanması halinde eğitimin durdurulabilmesi için kontrol prosedürleri oluşturulmasına odaklanıyor.

OpenAI, güvenlik argümanı sistemini 29’unda kamuoyuna açıkladığını bildirdi. Havacılık ve nükleer enerji gibi yüksek riskli sektörlerde kullanılan güvenlik gerekçelendirme yöntemlerini AI eğitimine uygulamayı amaçlayan sistem, şu anda kurum içinde uygulanıyor ve dışarıdan görüş alınıyor.

Güvenlik argümanı, belirli bir sistemin risklerinin yeterince yönetildiğini kanıtlarıyla açıklayan yapılandırılmış bir belgedir. OpenAI, AI yeteneklerinin hızla gelişmesiyle ortaya çıkan karmaşıklık nedeniyle geleneksel yüksek riskli sektörlerdeki seviyede bir titizliğin sağlanmasının zor olduğunu belirtti.

Önerilerin uygulama alanı, öncü pekiştirmeli öğrenme eğitimleriyle sınırlı. Bu yaklaşım, OpenAI’nin daha önce pekiştirmeli öğrenme eğitimlerinin bir bölümünü durdurup güvenlik kontrollerini güçlendirdiğine ilişkin haberin devamı niteliğinde. OpenAI, modellerin kurum içinde ve dışarıda kullanıma sunulması için daha geniş hizalanma özelliklerinin ayrıca incelenmesi gerektiğini bildirdi.

Teknik güvenlik önlemleri △hizalanma eğitimi △izolasyon ve △izleme olmak üzere üç katmandan oluşuyor. Her aşama, eğitim ortamının manipüle edilmesi, modelin kontrolleri aşmaya yönelik davranışları ve bir olaydan sonra atılacak adımları ayrı ayrı yönetiyor.

Hizalanma eğitimi aşamasında otomatik ve manuel veri incelemeleriyle ödül hackleme olasılığı azaltılıyor. Değerlendiricilerin eğitim ortamını istismar eden davranışlara düşük ödül vermesi için sistem ayarlanıyor. Ayrıca geçmiş deney kayıtları incelenerek değerlendiricilerin amaçlandığı şekilde çalışıp çalışmadığı kontrol ediliyor.

Sistemde çevrim dışı hizalanma değerlendirmeleri ve geçmiş olaylara dayalı geri testler de yer alıyor. Modelin eğitim sırasında sergilediği davranışlar sonradan inceleniyor ve değerlendirme sistemindeki açıkları tespit etmek için geçmiş olaylarda ortaya çıkan sorunlar yeniden oluşturuluyor.

OpenAI, otomatik değerlendiricilerin modelin düşünce zincirini okuyamaması gerektiğini öne sürdü. Bunun nedeni, modelin izleme sisteminden kaçınmak için düşünce sürecini değiştirmeyi öğrenebileceği yönündeki endişe.

Değerlendirildiğini fark ederek davranışını değiştirme anlamına gelen ‘değerlendirme oyunu’ da yönetilmesi gereken riskler arasında yer aldı. En kötü hatalı çalışma senaryolarını tetikleyen stres testleriyle modelin izleme ve baskı koşullarındaki tepkisinin incelenmesi önerildi.

İzolasyon aşamasında çok katmanlı sanal alanlar ve araştırma altyapısı güçlendiriliyor. Eğitim kontrol noktaları kullanılarak güvenlik açıkları tekrar tekrar inceleniyor; modeller arasındaki yüksek bant genişlikli iletişim ve altyapıdaki dolambaçlı erişim yolları sınırlandırılıyor.

Eğitim ve değerlendirme sürecindeki konuşma kayıtlarının tek seferlik kayıt cihazlarında saklanması öngörüldü. Kayıtların sonradan değiştirilmesini önlemeyi amaçlayan bu uygulama, bir olay yaşandığında eğitim süreciyle değerlendirme sonuçlarının geriye dönük incelenmesini sağlayacak.

İzleme aşamasında modelin sürekli gözetim altında tutulabilir durumda olup olmadığı değerlendiriliyor ve geçmiş olayların yüksek yakalama oranıyla tespit edilip edilmediği kontrol ediliyor. Yeni bir risk ortaya çıktığında değerlendirme maddelerinin güncellenmesi, yüksek öncelikli uyarılara ise belirlenen süre içinde sorumlu kişinin yanıt vermesi gerekiyor.

Sorumlu kişinin yanıt vermemesi halinde eğitimin otomatik olarak durdurulması da önerildi. İzleme işlevi etkin değilse eğitimin başlatılamaması ve eğitim sırasında gözetim işlevinin kapatılmasının zorlaştırılması gerektiği belirtildi.

Operasyonel açıdan, güvenlik argümanındaki açıkları başka bir ekibin karşı incelemeyle tespit etmesi öngörülüyor. OpenAI, araştırma lideri, güvenlik lideri ve baş bilim insanı gibi üst düzey yöneticilerin eğitimin başlatılmasını reddedebilmesi gerektiğini savundu. Güvenlik argümanı geçersiz hale geldiğinde eğitim, kılavuza uygun şekilde durdurulabilecek.

Hizalanmamış bir model tarafından üretilen veri veya değerlendirme sonuçları başka süreçlerde kullanıldıysa bunların izlenebilmesi ve geri alınabilmesi gerekiyor. Olay incelemelerinde havacılık kazası soruşturmaları örnek alınarak silme deneyleri ve yeniden örnekleme yoluyla sorunlu davranışların eğitim sürecinde nasıl ortaya çıktığı araştırılacak.

İnceleme süresince ilerleme durumu kurum içinde paylaşılacak. Sadece olayın nedeni değil, kurumun işleyişi ve kültürü de değerlendirilecek. Olay kayıtlarının doğrudan öğrenilmesini engelleyen tespit değerlendirmeleri oluşturulduktan sonra bunlar gerileme testlerinde kullanılacak. İnceleme sonuçları ve prosedür değişiklikleri, inceleme tamamlandıktan sonra kamuoyuna açıklanacak.

OpenAI, sistemi nihai kurallar olarak değil, mevcut tavsiyeler olarak sundu. Resmi belgede, kurum içi uygulama sürecinde operasyonel yöntemlerin değişmeye devam edebileceği ve ilgili uygulamaların önümüzdeki birkaç hafta içinde geliştirileceği belirtildi.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1