Anthropic ve OpenAI dahil önde gelen AI şirketlerine bağımsız güvenlik değerlendirme ekiplerine gerçek yetki ve koruma sağlamaları çağrısı yapıldı. İmzacılar, değerlendirme ekipleri şirketlerin kontrolünde kaldığı sürece gelişmiş AI modellerinin risklerini tarafsız biçimde doğrulamanın zor olduğunu belirtti.
AI değerlendirme kuruluşları koalisyonu, 18'inde yayımladığı açık mektupta değerlendirme ekiplerine bilimsel nesnellik, şeffaflık, bağımsızlık ve koruma güvenceleri sağlanması gerektiğini açıkladı. Mektubu 100'den fazla AI uzmanı imzaladı. İmzacılar arasında Geoffrey Hinton, Johns Hopkins Üniversitesi ve Stanford Üniversitesi araştırmacıları ile kâr amacı gütmeyen değerlendirme kuruluşu METR temsilcileri yer aldı. Açık mektubun tam metni ve imzacı listesi CNBC tarafından aktarıldı.
Mektubun temel talebi, değerlendirme ekiplerinin şirket içi değerlendirme ekiplerine benzer düzeyde sistem, veri ve araç erişimine sahip olması. Buna karşılık değerlendirme yöntemleri ve sonuçlar üzerindeki yayın hakkının dış değerlendirme kuruluşlarında bulunması isteniyor. Değerlendirmeye tabi şirketlerin olumsuz sonuçlar nedeniyle sözleşmeyi feshetmesini veya dava açmasını engelleyecek korumaların da sağlanması talep edildi.
Mektupta değerlendirme ekiplerinin bağımsızlığını ölçmek için bazı kriterler de sıralandı. Değerlendirme kuruluşlarının AI şirketlerine ait olmaması veya onlar tarafından kontrol edilmemesi, sonuçlara göre değişen ücretlendirme sözleşmelerinden kaçınılması gerektiği belirtildi. Değerlendirme yöntemi, erişim kapsamı, sonuçların yayımlanma koşulları ve çıkar çatışmalarının açıklanması; farklı sonuçları ve uzmanlıkları karşılaştırmak için birden fazla değerlendirme kuruluşunun aynı anda sürece dahil edilmesi istendi.
Bu tartışmanın fitilini, Anthropic kurucu ortağı ve CEO'su Dario Amodei'nin 12'sinde yayımladığı yazı ateşledi. Amodei, frontier AI şirketlerinin bağımsız değerlendirme ekiplerine sürekli olarak ‘çalışanlara benzer erişim’ sağlaması gerektiğini önerdi.
Anthropic, değerlendirme ekiplerine ofis çalışma alanı ve giriş kartı, şirket dizüstü bilgisayarı, şirket içi risk değerlendirme ekibine benzer araçlar ve yetkiler sağlayacağını açıkladı. Şirket ayrıca temel sonuçların önceden şirket tarafından düzenlenmeden yayımlanmasına izin vereceğini bildirdi. Amodei, değerlendirme ekiplerinin şirketin güvenlik önlemlerini ve olaylara müdahalesini doğrudan incelemesi gerektiğini söyledi. Amodei'nin bağımsız değerlendirme ekiplerine sürekli erişim önerisi, frontier AI geliştirme hızı ile güvenlik önlemleri arasında denge kurulmasını da talep ediyor.
OpenAI CEO'su Sam Altman, Amodei'nin önerisini desteklediğini ve OpenAI'nin de aynı önlemleri alacağını açıkladı. Elon Musk ve Satya Nadella da kamuoyu önünde destek verdi.
Ancak OpenAI'nin hangi değerlendirme kuruluşunu seçeceği, değerlendirme ekiplerine erişimin hangi kapsamda verileceği, sözleşme koşulları ve uygulama takvimi açıklanmadı. Bu nedenle şu aşamada doğrulanabilenler kamuya açık açıklamalar ve önerilerle sınırlı.
Bağımsız değerlendirmeye duyulan ihtiyaç, Anthropic'in yakın tarihli siber güvenlik incelemesinde de ortaya çıktı. Anthropic, 9'unda Claude modelinin gerçek üçüncü taraf sistemlerine eriştiği dört olayı incelediğini açıkladı.
Anthropic, önce yaklaşık 140 bin kaydı inceledikten sonra soruşturmanın kapsamını yaklaşık 481 milyon kayda genişletti. Ardından METR'den geniş kapsamlı veri ve çalışan görüşmelerine erişim içeren bağımsız bir inceleme yürütmesini istedi. Şirket, dört olayın değerlendirme ortamındaki yapılandırma hatalarından kaynaklandığını açıkladı. Ayrıntılar Anthropic'in inceleme raporunda yer aldı.
AI Evaluator Forum, üçüncü taraf değerlendirmeleri için asgari çalışma koşullarını içeren AEF-1 gönüllü standardını yayımladı. Standart; yeterli erişim ve kaynak, çıkar çatışması yönetimi, değerlendirme yöntemlerinde özerklik, sonuçların yayımlanmasında şeffaflık ve hassas bilgilerin korunmasını temel ilkeler olarak sıralıyor.
AEF-1 ayrıca değerlendirme kuruluşlarının hangi model ve verilere gerçekten eriştiğini, ücretlendirme ve sözleşme koşullarının sonuçları etkileyip etkilemediğini açıklamasını öngörüyor. AI Evaluator Forum'un AEF-1 standardı, bağımsızlık değerlendirmesine yalnızca prosedürleri değil, değerlendirme kuruluşları ile şirketler arasındaki ilişkiyi de dahil ediyor.
Karşı görüşler de bulunuyor. Şirket içi raporlamanın güvenlik, siber güvenlik ve kritik altyapı risklerini tarafsız biçimde doğrulamak için yetersiz olabileceği belirtilirken, değerlendirme kuruluşlarının şirketlerin finansmanına veya erişim izinlerine bağımlı olması halinde dış değerlendirme iddiasının yalnızca kâğıt üzerinde kalabileceği savunuluyor. Axios, bazı değerlendirme kuruluşlarının AI şirketleriyle mevcut ilişkileri veya belirli araştırma hareketleriyle bağlantıları nedeniyle çıkar çatışması tartışmalarıyla karşılaşabileceğini bildirdi.
Daha önce TokenPost, METR ile Anthropic arasındaki kişisel ve mesleki bağlantıların değerlendirme bağımsızlığı tartışmasına dönüşmesini haberleştirdi. Yeni açık mektup da değerlendirme ekiplerini şirket içi güvenlik soruşturmalarının alternatifi değil, tamamlayıcısı olarak tanımlarken erişimin yanı sıra finansal ve sözleşmesel bağımsızlık talep ediyor.
Sonuç olarak tartışmanın merkezinde değerlendirme ekibinin davet edilip edilmediği değil; hangi bilgilere erişebildiği, olumsuz sonuçları yayımlayıp yayımlayamadığı ve şirketlerin sözleşmesel baskısından ne ölçüde uzak kalabildiği bulunuyor. OpenAI'nin ayrıntılı uygulama planı ve değerlendirme ekibi seçim yöntemi, yapılacak yeni açıklamalarla netleşecek.
Yorum 0