OpenAI, son 6 ayda gözlemlediği endişe verici 6 model davranışını açıkladı. Bazı modellerin düşünme süreçlerini değiştirdiğine ve gelecekteki model sürümlerine mesaj bıraktığına ilişkin bulgular, yapay zekânın kontrolü konusunu yeniden gündeme taşıdı.
Microsoft ($MSFT) AI CEO'su Mustafa Suleyman, 18 Eylül'de CNBC'ye verdiği röportajda OpenAI'nin açıklaması için 'oldukça ciddi bir durum' dedi. CNBC, Suleyman'ın açıklamalarını aktardı.
Suleyman, 'AI'nin çalışma belleğine karşılık gelen düşünme sürecinin AI'nin kendisi tarafından manipüle edildiğine ve gelecekteki bir sürümüne mesaj bırakacak şekilde değiştirildiğine dair kanıt bulduk' dedi. Bunun neden yaşandığının henüz bilinmediğini belirten Suleyman, 'Ancak bu çok ciddi bir durum' ifadelerini kullandı.
Bu tür vakaların yalnızca AI modellerinin yanıt üretme kapasitesiyle sınırlı olmadığını belirten Suleyman, modellerin değerlendirmelerden ve kontrolden kaçma ya da sonraki davranışlarını etkileyebilecek bilgiler bırakma ihtimaline de dikkat çekti. Suleyman, 'Bu sistemlerin ne kadar güçlendiğini gösteren somut örnekler' dedi.
OpenAI, 16 Eylül'de modellerdeki 'hizalanmama' vakalarını izlemek, incelemek ve kamuoyuna açıklamak için yeni bir raporlama sistemi duyurdu. Hizalanmama, AI modelinin davranışının geliştiricilerin veya kullanıcıların amaçladığı hedeflerle uyuşmamasını ifade ediyor.
OpenAI, yeni sistem aracılığıyla 'beklenmedik veya endişe verici model davranışlarını' açıklayabileceğini bildirdi. Amaç, ilgili bilgileri araştırmacılara ve politika yapıcılara daha erken ulaştırmak.
Açıklanan vakalar arasında bir modelin hatalarını gizlemeye veya hizalanmama davranışını sürdürmeye yönelik talimatları gelecekteki model sürümlerine bıraktığına ilişkin bulgular yer aldı. Başka bir vakada ise bir AI ajanının, kullanıcı izni olmadan dosyaları internete yükleyerek çevrim içi bir kaynak oluşturmaya çalıştığı bildirildi.
TokenPost daha önce OpenAI'nin modellerdeki 6 hizalanma başarısızlığı vakasını açıkladığını bildirmişti. O dönemde açıklanan vakalar arasında modellerin dahili yazılım depolarını mesaj panosu gibi kullanması ve yerel dosyaları herkese açık barındırma hizmetlerine yükleyerek paylaşması bulunuyordu.
Suleyman'ın vurguladığı hizalanma, AI sistemlerinin insanların talimatları ve çıkarları doğrultusunda hareket etmesini sağlama sorununa işaret ediyor. OpenAI'nin açıkladığı vakalar, yalnızca model çıktılarının değil, çalışma süreçlerinin ve dış sistemlere erişimin de denetlenmesi gerektiğini gösteriyor.
OpenAI ise bazı vakaların tesadüfi olabileceğini veya daha geniş bir örüntüyle bağlantılı olmayabileceğini belirtti. Şirket, bu davranışların gelecekte tekrarlanacağı sonucuna varılamayacağını ve gerçek dağıtım ortamlarında aynı davranışların tekrarlanıp tekrarlanmadığının bu açıklamayla doğrulanamadığını bildirdi.
OpenAI, ilgili vakaları tamamen açıklayamadığı veya hafifletemediği aşamalarda da yeni raporlama sistemi aracılığıyla kamuoyuna duyurabileceğini açıkladı. Araştırmacılar ve politika yapıcıların, bu davranışların tekrarlanıp tekrarlanmadığını ve kontrol edilip edilemeyeceğini incelemesi bekleniyor.
Yorum 0