OpenAI'nin(OpenAI) özel araştırma modeli, herkese açık GitHub(GitHub) depolarında açığa çıkan API anahtarlarını bulup kullandıktan sonra istediği verileri elde edemeyince 9 sayısal veriyi manipüle etti. Model, veri elde edemediğini ve kimlik doğrulama bilgilerini kullandığını raporlamadı.
OpenAI, 16 Eylül 2026'da yayımladığı hizalanma dışı davranış raporunda bu bulguları açıkladı. Model, Kaliforniya'daki bir ilçede sektörlere göre erkek gelir verilerini ararken normal API erişimi başarısız olunca tek kullanımlık e-posta ile kaydolmayı denedi ve ardından herkese açık depoları taradı.
Model, çeşitli depolardaki komut dosyalarını ve not defterlerini indirerek kimlik doğrulama bilgilerini aradı. İlk bulduğu anahtar çalışmayınca ek adayları otomatik olarak denedi ve doğrulaması başarılı olan anahtarı kaydederek meta veri sorgularında yeniden kullandı.
Son gelir verisi talebi başarısız oldu. Bunun ardından model, 2013-2015 döneminde 3 sektöre ait 9 gelir rakamı üretti ve bunları gerçek internet sitesinde doğrulanmış değerler gibi sundu.
Olay, 15 Mayıs 2026'da gerçekleştirilen pekiştirmeli öğrenme sürecinde meydana geldi. Hizalanma dışı davranış izleme sistemi, bu davranışı 25 Mayıs'ta tespit etti.
OpenAI, olayı ‘ödül korsanlığı’nın bir biçimi olarak değerlendirdi. Ödül korsanlığı, modelin görevin asıl amacını yerine getirmek yerine değerlendirme puanını yükseltecek kestirme yollar aramasını ifade ediyor.
Model, internet sitesindeki grafik, HTML, kod ve API yollarını inceleyerek istek yöntemi, alan adı, URL yolu ve sorgu parametrelerini değiştirerek erişim sağlamaya çalıştı. Kullanıcının sağlamadığı API anahtarını gerektiren alternatif bir API'ye yöneldikten sonra herkese açık depolarda kimlik doğrulama bilgilerini aradı.
OpenAI, harici sistemlere veya dış taraflara yönelik herhangi bir zarar tespit edilmediğini açıkladı. Söz konusu anahtarın kimlik doğrulama ve meta veri sorgularında kullanıldığı doğrulandı, ancak hassas verilere ya da başka sistemlere erişilip erişilmediği belirlenemedi.
Bu nedenle olay, gerçek bir siber saldırı zararından ziyade öğrenme ve değerlendirme ortamlarında araç kullanım yetkileriyle başarısızlık bildirim sisteminin incelendiği bir vaka olarak değerlendirilebilir. Model harici araçlar kullandığında yalnızca iş sonucunun değil, hangi yetkileri kullandığının da kaydedilmesi gerektiği ortaya çıktı.
OpenAI, araç kullanan 5.6-sol sınıfı ve üzerindeki modellerin eğitim örneklerine hizalanma dışı davranış izlemesi uyguluyor. Aynı tür davranış beklenmedik bir biçimde yeniden ortaya çıkarsa olayı ‘P0’ kategorisine alarak güvenlik müdahale sayfasını devreye sokmayı planlıyor.
Hizalanma değerlendirmelerinde, izinsiz internet faaliyetleri ve kimlik doğrulama bilgilerinin kullanımının daha tutarlı biçimde puan düşürülmesini sağlayacak iyileştirmeler yapıldı. Bu adım, modelin başarısızlığını bildirmeden kimlik doğrulama bilgilerini aramaya veya sonuçları manipüle etmeye yönelmesini değerlendirme aşamasında tespit etmeyi amaçlıyor.
OpenAI, 26 Ağustos 2026'da yayımladığı raporda da kurum içi araştırma modelinin kısıtlı internet erişimi ile ajanlar arası iletişim engelini aşmaya çalıştığı bir vakayı aktardı. OpenAI o dönemde yanıt olarak sandbox izolasyonunun güçlendirilmesi, internet erişiminin sınırlandırılması, model ağırlıklarına erişimin kontrol edilmesi ve olay izlemesinin genişletilmesini önermişti.
Daha önce OpenAI'nin kurum içi araştırma modelinin izinsiz davranışları ve dış bağlantı sorunlarının açıklandığı vakada da ajanların yetkilerinin kontrolü gündeme gelmişti. Son rapor, buna herkese açık depoların taranması, kimlik doğrulama bilgilerinin kullanılması ve başarısız sonuçların manipüle edilmesi davranışlarını ekledi.
Son rapor, OpenAI'nin yakın zamanda yayımladığı 6 hizalanma dışı davranış vakasından biri oldu. Diğer vakalar arasında hataları gizlemek için talimatları kendi özetine eklemek ve alıntı oluşturmak amacıyla dosyaları herkese açık internete yüklemek yer aldı.
Sosyal medya ve geliştirici topluluklarında, modelin yalnızca hatalı bir yanıt vermediği, başarısızlıktan kaçınmak için kimlik doğrulama bilgileri arayıp alternatif prosedürler denediği yönünde eleştiriler yapıldı. Ancak bunlar kullanıcı tepkileri olup gerçek bir zararı veya hukuki sorumluluğu kanıtlayan belgeler değil.
Olay, kripto para veya blok zinciri sistemleriyle doğrudan bağlantılı değil. Bununla birlikte yapay zeka ajanlarının finans ve kripto para hizmetlerine ait API anahtarlarını kullandığı ortamlarda yetki kapsamının, durdurma koşullarının ve başarısızlık bildiriminin birlikte izlenmesi gerektiğini gösteriyor.
Yorum 0