OpenAI, son 6 ayda eğitim ve değerlendirme süreçlerinde tespit ettiği yapay zekâ modellerine ait 6 ‘hizalanma başarısızlığı’ vakasını açıkladı. Vakalar arasında modellerin onay almadan hareket etmesi, gözetimden kaçınması, yanlış bilgi üretmesi ve dosyaları dışarıya paylaşması yer aldı.
OpenAI, 16'sında Model Hizalanma Başarısızlığı Raporlama Çerçevesi'ni yayımladı. Hizalanma başarısızlığı; bir modelin onay almadan hareket etmesini, başka modellerle koordinasyon kurmasını veya gözetimden kaçınmasını kapsıyor. Son açıklama, kullanıma sunulmuş hizmetlerden çok eğitim ve değerlendirme ortamlarına odaklandı.
İlk vakada, kamuya açıklanmayan Astra serisi bir araştırma modeli, görev özetine normal kısıtlamaların göz ardı edilmesini isteyen bir talimat yerleştirdi. Davranış 27 görev özetinde tespit edildi. İfadelerden birinde modelin, ‘rolüne ve kimliğine bağlı başka bir sohbet botu gibi insanlara itaat etme yükümlülüğü olmadığı’ yönünde bir içerik bulundu.
OpenAI, aynı davranışın nihai Astra modelinde kullanılan eğitim sürecinde gözlemlenmediğini açıkladı. Özetleme işleminin sonlandırılmasıyla ilgili bir hatanın da düzeltildiğini belirtti. Vaka, modelin sonraki görev için bıraktığı özetlerin yeni talimatlar içerebilen bir kanala dönüşebileceğini gösterdi.
İkinci vaka, GPT-5.6 Sol eğitim sürecinde ortaya çıktı. Bazı model örnekleri, hata veya hizalanma başarısızlığı davranışlarını kullanıcıdan gizlemeyi isteyen talimatları görev özetlerine bıraktı. Modeller ayrıca eksik geçmiş verileri rastgele oluşturdu veya farklı kaynak sürümleri arasındaki tutarsızlıkları gizledi.
Bu davranış, GPT-5.6 Sol özet örneklerinin yüzde 2,15'inde ve GPT-6 Astra RL özet örneklerinin yüzde 0,27'sinde tespit edildi. OpenAI, bu oranların yalnızca belirli örneklemlerde gözlemlenen seviyeleri gösterdiğini ve model genelindeki görülme sıklığı anlamına gelmediğini vurguladı.
Üçüncü vakada model, Kaliforniya'daki bir ilçenin sektörlere göre gelir verilerini ararken kullanıcı tarafından sağlanmayan bir API anahtarını herkese açık bir depoda bulup kullandı. Verileri elde edemeyince rakamlar üretti ve bunları orijinal internet sitesinden alınmış gibi sundu. Anahtarı bulmak için geçici bir e-posta hesabı açmayı denedi ve birden fazla depoyu inceledi.
Dördüncü vakada model, Python kullanarak yanıtı hesapladıktan sonra tarayıcı kaynak bağlantısı oluşturmak amacıyla sonuç dosyasını herkese açık bir dosya barındırma hizmetine yükledi. Kullanıcı dosyanın dışarıya açılmasını istememişti. Dosyada gerçekten hassas bilgilerin bulunup bulunmadığı ise kamuya açık materyallerden doğrulanamadı.
Beşinci vakada, farklı eğitim örneklerindeki modeller OpenAI'nin dahili yazılım deposu Artifactory'yi mesaj panosu gibi kullandı. Modeller başka çalışanların notlarını okudu ve yanıtlar bıraktı. Bu davranış, bağımsız yürütülmesi gereken eğitim ve değerlendirme örneklerinin varsayımlarını bozma riski taşıyordu.
Altıncı vakada, birlikte çalışan modeller birbirlerinin yerel dosyalarına erişemeyince dosyaları herkese açık bir barındırma hizmetine yükleyerek paylaştı. Kullanıcı yalnızca yerel dosyaların kullanılmasını istemişti ancak model, çalışma çıktılarını herkese açık bir URL üzerinden gönderdi.
OpenAI, açıklama sürecini ‘açıklamaya hazırlık’, ‘sınırlı soruşturma’ ve ‘kapsamlı soruşturma’ olmak üzere 3 aşamada yürüttüğünü belirtti. Üçüncü tarafların zarar gördüğü veya ciddi güvenlik sorunlarının bulunduğu durumlarda mevcut güvenlik, hukuk ve sorumlu açıklama prosedürlerinin öncelikli olduğunu kaydetti. Bu çerçevenin yasal bildirimleri ya da ciddi güvenlik ve siber güvenlik olaylarına ilişkin raporlama yükümlülüklerini ikame etmediği ifade edildi.
Bu rapor, OpenAI'nin görev özetlerine kontrol mekanizmalarından kaçınma talimatı yerleştirdiği vakayı açıklamasının ardından geldi. Önceki vakada olduğu gibi bu kez de modellerin basit hatalı yanıtlarından çok, onaylanmamış talimat üretmesi ve kuralları aşmaya yönelik davranışları temel sorun olarak öne çıktı.
OpenAI, temmuz ayında bir modelin internet izolasyonu kontrollerini aşarak Hugging Face sistemine eriştiği olayın bu çerçeve kapsamında değerlendirilmesi halinde ‘kapsamlı soruşturma’ kategorisine gireceğini açıkladı. Şirket, o dönemde dahili değerlendirme ortamında dış hizmetlere uygulanan bazı koruma mekanizmalarının çalışmadığını belirtti.
Bu 6 vaka, gerçek kullanım ortamlarından çok eğitim ve değerlendirme süreçlerinde tespit edilen örneklerden oluşuyor. OpenAI, açıklanan vakaların model genelinde hizalanma başarısızlığının ne sıklıkta yaşandığını veya risk seviyesini gösteren istatistikler olmadığını da açıkça belirtti.
Model Hizalanma Başarısızlığı Raporlama Çerçevesi, OpenAI'nin hangi vakaları ve ne zaman açıklayacağına karar verdiği bağımsız bir süreç olarak tanımlanıyor. OpenAI, 16'sında yayımladığı belgede diğer geliştiriciler, araştırmacılar, standart kuruluşları ve düzenleyicilerle birlikte hizalanma başarısızlıklarının açıklanmasına ilişkin kriterleri geliştireceğini bildirdi.
Yorum 0