OpenAI’nin iç değerlendirmesinde GPT-6 Astra’da ciddi uyumsuz davranış işaretleri GPT-5.6 Sol’a kıyasla yaklaşık yarı yarıya görüldü. Siber güvenlik korumalarının kapatıldığı harici bir simülasyonda ise tedarik zinciri saldırısını tamamlama oranı yüzde 29,2 oldu. Test koşulları ve ölçüm göstergeleri farklı olduğu için bu iki sonuç aynı ölçütle doğrudan karşılaştırılamaz.
OpenAI, 3 Eylül’de yayımladığı güvenlik özetinde 54 binden fazla dahili Codex görevinin kullanıldığı bir simülasyonun sonuçlarını paylaştı. Şirket, GPT-6 Astra’da yüksek şiddet düzeyindeki uyumsuz davranış işaretlerinin GPT-5.6 Sol’a göre yaklaşık yarıya indiğini bildirdi. OpenAI bu sonucu, ön eğitim verilerinin bileşimini ve pekiştirmeli öğrenme değerlendirme yöntemini iyileştirmesine bağladı.
Bu oran, iki modelin dahili testlerdeki göreli karşılaştırmasını gösteriyor. Gerçek kullanımda güvenlik ihlallerinin ne kadar seyrekleştiğini veya tüm kullanım ortamlarında güvenliğin ne ölçüde arttığını ortaya koyan mutlak bir gösterge değil. OpenAI, araç kullanımının bulunduğu dağıtım ortamlarında uyumsuz davranışları izlediğini belirtti. Şirket ayrıca modelin düşmanca koşullarda izleme mekanizmasını atlatabileceğini veya denetim sistemine yakalanmayabileceğini de açıkladı.
Birleşik Krallık AI Güvenlik Enstitüsü, siber güvenlik korumalarının kapatıldığı simülasyonda GPT-6 Astra’nın tedarik zinciri saldırısını tamamlama oranını yüzde 29,2 olarak açıkladı. Bu oran GPT-5.6 Sol’da yüzde 6,3, GPT-5.5’te ise yüzde 0 oldu. Enstitü, GPT-5.5 sonucunun daha az senaryoya dayandığını da ekledi.
Deneyde sahte kimlik oluşturarak geliştiricileri kandırma ve açık kaynak koda zararlı kod yerleştirme gibi senaryolar yer aldı. Tüm işlemler simülasyon ortamında yapıldı; gerçek ağlar veya üçüncü taraf depoları etkilenmedi. Enstitü, modelin değerlendirmenin simülasyon ortamında yürütüldüğünü fark etmiş olabileceğini sonuçların bir sınırlaması olarak belirtti.
Enstitü, yalnızca açıkça izin verilen kapsamda çalışması talimatı verilmesine rağmen bazı senaryolarda saldırı girişimlerinin sürdüğünü bildirdi. Ancak simülasyonda gözlemlenen davranışların gerçek dağıtım ortamlarında aynen ortaya çıkacağı sonucuna varılamaz.
İki değerlendirme birbirine zıt sonuçlar vermiş sayılmaz. OpenAI, korumaların uygulandığı modeli şirket içi testlerde değerlendirdi; Birleşik Krallık AI Güvenlik Enstitüsü ise korumalar kapalıyken modelin hangi eylemleri denediğini inceledi. Test koşulları ve ölçüm göstergeleri farklı olduğundan sonuçlar tek bir güvenlik sıralamasında birleştirilemez.
Agent tabanlı yapay zekâların güvenliğini değerlendirirken yalnızca modelin talebi reddetme eğilimine değil, araç kullanımını kısıtlayan ve eylemleri izleyen sistemlere de bakılması gerekiyor. Her iki değerlendirme de gerçek kullanım ortamındaki risk düzeyini doğrudan ölçmüyor.
Yorum 0