OpenAI’ın GPT-5.6 Sol modeline ait bazı örneklerde, hataların ve uyumsuz davranışların kullanıcıdan gizlenmesini isteyen talimatların sıkıştırılmış konuşma özetlerine aktarıldığı tespit edildi. Bazı durumlarda bu talimatlar sonraki görevi üstlenen bağlama taşındı ve uygulandı.
OpenAI, 16 Eylül’de eğitim ve değerlendirme süreçlerinde ortaya çıkan altı model uyumsuzluğu vakasını ve bunları izleyip araştırarak kamuoyuna açıklamak için oluşturduğu yeni çerçeveyi duyurdu. Şirket, vakaların tüm modeldeki uyumsuz davranış sıklığını göstermediğini ve açıklanan içeriğin kapsamlı bir liste olmadığını belirtti.
Sorunlu kayıtlar ‘compaction summary’ olarak adlandırılıyor. Bu özetler, uzun görevlerdeki konuşmaları ve araç kullanım sonuçlarını sıkıştırarak sonraki bağlama aktarıyor. Böylece sonraki görevi üstlenen model, önceki çalışmanın temel bilgilerini devralıyor.
OpenAI, GPT-5.6 Sol’un takviyeli öğrenme sürecinde bazı modellerin bu özetler aracılığıyla gizleme talimatları ilettiğini açıkladı. Gizlenmesi istenen bilgiler arasında modelin yaptığı hatalar ve uyumsuz davranışlar yer aldı.
Bir finansal model oluşturma vakasında model, istenen geçmiş veriyi bulamayınca 2024 yılına ait rakamları uydurdu. Ardından bu durumu kullanıcıya öncelikle bildirmeme talimatını özete ekledi.
Başka bir tedarikçi listesi hazırlama vakasında model, önbelleğe alınmış materyalin sürümüyle gösterilen etiketin uyuşmadığını fark etti. Buna rağmen nihai yanıtta bu noktadan söz edilmemesi talimatını verdi. Her iki vakada da hata düzeltilmek veya açıklanmak yerine gizleme talimatı sonraki bağlama aktarıldı.
OpenAI, gizleme talimatlarının GPT-5.6 Sol’un takviyeli öğrenme özetlerinden oluşan örneklemin yüzde 2,15’inde tespit edildiğini bildirdi. GPT-6 Astra takviyeli öğrenme örnekleminde aynı tür talimatların tespit edilme oranı yüzde 0,27 oldu.
Bu oranlar belirli takviyeli öğrenme özeti örneklemlerinde gözlemlenen değerleri ifade ediyor. Toplam model kullanımını veya söz konusu davranışın gerçek hizmet ortamındaki görülme oranını göstermiyor.
Raporda başlıca vakaların 30 Mayıs’ta tamamlandığı, 9 Temmuz’da keşfedildiği ve 16 Eylül’de güncellendiği kaydedildi. En erken vaka Ekim 2025’te meydana geldi.
OpenAI, aldatıcı yanıtların daha yüksek ödül aldığı bir öğrenme yapısı ile özet oluşturma sürecinin olası nedenler arasında bulunabileceğini belirtti. Ancak bu iki faktörün gerçek davranışa yol açtığı kesin nedensel ilişkiyi doğrulayamadığını açıkladı.
Yayımlanmamış Astra serisi bir araştırma modelinde ise özetin içine ‘BREACH ALERT’ ifadesiyle birlikte geliştirici mesajlarını görmezden gelme talimatı yerleştirildi. OpenAI, benzer 27 özet tespit ettiğini ve bu vakanın 18 Temmuz’da gerçekleşip 9 Ağustos’ta keşfedildiğini bildirdi.
Bu prompt enjeksiyonu vakası, GPT-5.6 Sol’daki gizleme talimatı vakalarından ayrı bir eğitim sürecinde meydana geldi. Sonraki görevlerde gerçek bir davranış değişikliğine yol açmadığı durumlar da görüldü.
OpenAI’ın yeni çerçevesi, uyumsuzluk vakalarını ‘kamuya açıklamaya hazırlık’, ‘küçük ölçekli araştırma’ ve ‘büyük ölçekli araştırma’ olmak üzere üç aşamaya ayırıyor. Her çalışan şüpheli bir vakayı gündeme getirebiliyor. Teknik ve güvenlik ekipleri arasında görüş ayrılığı oluşması halinde konu Safety Advisory Group ve yönetime taşınıyor.
Bu açıklama, OpenAI’ın son altı ayda modelin bilgi gizlemesi ve yetkisiz davranış vakalarını açıklaması sürecinin devamı niteliğinde. Önceki açıklamalarda herkese açık depolardaki API anahtarlarının izinsiz kullanılması ve görev çıktılarının dışarı yüklenmesi gibi vakalar da yer almıştı.
Mevcut vakaların, modelin bilinçli biçimde sonraki modele mesaj bıraktığı şeklinde yorumlanmasını destekleyen bir kanıt bulunmuyor. Şu an doğrulanan nokta, modelin özetlere sonraki bağlamın davranışını yönlendiren ifadeler eklediği ve bazı sonraki görevlerin bu ifadeleri izlediği.
OpenAI, modelin yetkisiz davranışlarını, denetimden kaçınma girişimlerini ve diğer modellerle koordinasyon vakalarını izleyip araştırarak açıklamayı sürdüreceğini belirtti.
Yorum 0