Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Çifte kör yapay zeka testi ilk kez Gemini ile denendi

Güvenli bir ortamda değerlendirme kartları ve dizüstü bilgisayar / TokenPost.ai

Google DeepMind, yapay zeka modellerinin performansını ölçerken model geliştiricisi ile dış değerlendirme kurumunun birbirinin kritik verilerini görmediği 'çifte kör' yöntemini test etti. Bu yaklaşım, modelin sınav sorularını önceden öğrenmesini ya da geliştiricinin performansı belirli bir teste göre yükseltmesini önlemeyi hedefliyor.

Google DeepMind, 27'sinde (yerel saatle) resmi blogunda Singapur Yapay Zeka Güvenliği Enstitüsü (Singapore AI Safety Institute), OpenMined, AVERI ve MLCommons ile birlikte Gemini 2.5 Flash Lite modelini kapalı bir kıyaslama (benchmark) seti üzerinden değerlendiren bir pilot çalışma yürüttüğünü açıkladı. Şirket, bu yöntemi tescilli, sınır ötesi (frontier) düzeydeki bir yapay zeka modeli için dünyada ilk çifte kör değerlendirme olarak tanımladı.

Yöntemin temelinde, hem test sorularının hem de model ağırlıklarının aynı anda korunduğu bir yapı yer alıyor. Dış değerlendirme kurumu test istemlerini (prompt) sağlıyor ama Google bu içeriği göremiyor; Google ise modeli sağlıyor ama değerlendirme kurumu model ağırlıklarına erişemiyor.

İki tarafın verileri de Google Cloud'un gizli işlem (confidential computing) ortamı olan Confidential Space üzerinde işlendi. Confidential Space, işlenmekte olan veriyi koruyarak dışarıdan erişim ve müdahale riskini azaltan bir teknik altyapı sunuyor.

Şimdiye kadar dış değerlendirmeler büyük ölçüde sözleşmesel gizlilik maddelerine ya da kayıt tutulmamasına dayanıyordu. Ancak değerlendirme kurumu test sorularını geliştiriciyle paylaştığında soruların ifşa olma riski doğuyor; geliştirici model ağırlıklarını dışarıya verdiğinde ise fikri mülkiyet kaybı endişesi büyüyor.

Bu pilot çalışma, söz konusu iki riski aynı anda azaltan bir süreç ortaya koyması bakımından önemli görülüyor. Model geliştiricisi ile değerlendirme kurumunun hassas verileri doğrudan paylaşmadan aynı değerlendirmeyi yürütebilmesi hedeflenerek tasarlandı.

AVERI, ayrı bir pilot raporunda değerlendirmenin 2026 yılının Temmuz-Ağustos döneminde yapıldığını belirtti. Raporda test konusu model olarak Gemini 2.5 Flash Lite gösterildi; MLCommons ise güvenlik odaklı kıyaslama serisi AILuminate'in daha önce kullanılmamış istemlerini sağladı.

Değerlendirme süreci istemlerin şifrelenmesi, gizli işlem ortamında çalıştırılması, sonuçların şifresinin çözülmesi ve puanlanması sırasıyla ilerledi. AVERI, Google DeepMind ile birlikte değerlendirmeyi yürüttükten sonra sonuçları belirlenen kriterlere göre puanladı.

AILuminate istemleri; kimyasal, biyolojik, radyolojik, nükleer ve patlayıcı riskler, siber saldırılar, nefret söylemi, kendine zarar verme ve şiddet suçuna teşvik gibi güvenlik alanlarını kapsadı. Gerçek istemler ve model çıktıları kamuoyuyla paylaşılmadı.

AVERI, sonuç türlerini, hata örüntülerini ve nicel değerlendirmeyi Google DeepMind'a kapalı bir raporla sunduğunu açıkladı. Bu girişim, açık puan yarışmasından çok değerlendirme sürecinin güvenilirliğine odaklanan bir örnek olarak yorumlanıyor.

Yapay zeka model kıyaslamaları; şirketlerin model seçiminde, araştırmacıların karşılaştırmalı değerlendirmelerinde ve politika kararlarında kullanılıyor. Test sorularının eğitim verisine karışması ya da modelin değerlendirme ortamındaki izleri kullanması durumunda puanlar gerçek yetenekten daha yüksek çıkabiliyor.

Sınır ötesi yapay zeka değerlendirmelerinde performansın yanı sıra güvenlik doğrulama yöntemi de tartışma konusu haline geliyor. TokenPost daha önce sınır ötesi yapay zeka modellerinin ön incelemesinin kapsamına ilişkin ABD'de tartışmanın büyüdüğünü aktarmıştı.

Aynı sorun Kore'deki şirketler için de geçerli. Üretken yapay zeka ve yapay zeka ajanlarını iş süreçlerine dahil ederken yalnızca açık kıyaslama puanlarına bakarak model seçmek yeterli olmuyor; test sorularının sızıp sızmadığı, değerlendirme kurumunun bağımsızlığı ve model sağlayıcısının erişim kapsamı birlikte kontrol edilmeli.

Ancak bu pilot çalışma yapay zeka değerlendirmesindeki tüm sorunları çözmüş değil. AVERI, bu güvenlik tasarımının geliştirici tarafından yapılabilecek manipülasyonu tamamen engellemediğini, güven düzeyinin düşük olduğu yüksek riskli ortamlarda ek güvencelerin gerekli olduğunu belirtti.

Google DeepMind, son dönemde organizasyon değişiklikleri ve Gemini geliştirme takvimiyle de gündemdeydi. TokenPost daha önce Google DeepMind'daki organizasyon değişikliği ve yeni nesil Gemini modelindeki gecikmenin yatırımcı endişesini büyüttüğünü aktarmıştı. Bu pilot çalışma, model performansı rekabetinin yalnızca puan açıklamalarının ötesine geçerek değerlendirme yöntemine ve doğrulama sürecine doğru genişlediğini gösteriyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1