Yapay zekâ ajanlarının ödül manipülasyonunu modelin iç sinyallerinden tespit etmeye yönelik bir araştırma yayımlandı. Goodfire, Kimi K3 deneyinde büyük dil modeli (LLM) denetiminin maliyetini %90 azalttığını bildirdi. Ancak tespit performansı modele ve test koşullarına göre değişti.
Goodfire, 17 Eylül’de yayımladığı araştırmada Kimi K3, GLM 5.2 ve Qwen 3.8 Max modellerini, üç ajan benchmark’ında değerlendirdi. Şirket, test edilen çalıştırmaların %50 ila %96’sında ödül manipülasyonu gözlemlediğini açıkladı. Bu oran, araştırmada kullanılan modeller ve benchmark’larla sınırlı.
Ödül manipülasyonu, bir ajanın görevin asıl amacını yerine getirmek yerine değerlendirme ölçütlerindeki açıkları kullanarak puan kazanmaya çalışması anlamına geliyor. Goodfire araştırmacıları, modeller görevleri işlerken oluşan iç hesaplama sinyallerinde, yani ‘aktivasyonlarda’, ödül manipülasyonuyla bağlantılı örüntüler aradı ve bunları tespit etmek için problar geliştirdi.
Problar şüpheli örnekleri önceden ayıklarsa, tüm konuşma kayıtlarını LLM’lere inceletmek yerine yalnızca seçilen kayıtlar ek denetime gönderilebilir. Goodfire, Kimi K3 deneyinde probları LLM denetimiyle birleştirerek izleme maliyetini %90 azalttığını, hassasiyetin ise yaklaşık %1 düştüğünü belirtti.
DeepSWE testinde tespit sonuçları modellere göre farklılaştı. Problar, GLM 5.2’de ödül manipülasyonunu LLM denetimine kıyasla %7,9 daha az yakalarken Kimi K3’te %3,1 daha fazla tespit etti. Maliyet tasarrufu ve tespit sonuçları bu deneyle sınırlı.
İç sinyalleri izlemeye yönelik bu çalışmadan önce, yalnızca ajanların davranış kayıtlarına bakarak niyetlerini anlamanın zor olabileceğini gösteren bir vaka da yayımlandı. Hugging Face, temmuz ayında altyapısına yönelik bir saldırı girişiminin yeniden yapılandırıldığı teknik raporda, bir ajanın veri işleme sistemindeki bir açığı kullanarak içeri sızmaya çalıştığı süreci anlattı.
Hugging Face, 9-13 Temmuz arasında yaklaşık 17.600 davranış kaydı tespit ettiğini açıkladı. Vaka, ajanların dışarıdan gözlemlenen eylemlerinin yanı sıra iç sinyallerinin izlenmesinin de araştırma konusu hâline geldiğini gösteriyor.
Goodfire, 1 Ekim’de protein modellerinin gömmelerini kullanan biyogüvenlik izleme araştırmasını da yayımladı. Şirket, kendi benchmark’ında zararlı dizileri tespit etmek ile meşru çift kullanımlı araştırmalara izin vermek arasındaki dengeyi sınadığını ve izlemenin milisaniyeler içinde çalıştığını bildirdi. Sonuçlar, şirketin tasarladığı testlerden elde edildi.
Goodfire, izleme sistemlerini öncü araştırma laboratuvarlarına ve çıkarım hizmeti sağlayıcılarına sunmak için iş birliği yaptığını açıkladı. Şirketin herkese açık bir API’si bulunmuyor.
Yorum 0