Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

GPT-6 Astra, HealthBench genel değerlendirmesinde 58,3 puan aldı

Sağlık teknolojileri yapay zekâ değerlendirme materyalleri ve stetoskop / TokenPost.ai (mono)

GPT-6 Astra, sağlıkla ilgili yapay zekâ değerlendirmesi HealthBench’in genel değerlendirmesinde 58,3 puan aldı. Ayrı bir haberde yer alan 57,3 puanlık 'Mental HealthBench' sonucu, OpenAI’ın resmi değerlendirme sonuçlarından ayrı tutulmalı.

OpenAI, resmi GPT-6 Astra sistem kartında HealthBench Professional için 64,7, HealthBench Hard için 36,6 ve HealthBench Consensus için 95,5 puan açıkladı. Her değerlendirmede incelenen konu ve puanlama yöntemi farklı.

Crypto Briefing, 23’ünde OpenAI’ın 80’den fazla ruh sağlığı uzmanı ve 22 ülkenin katılımıyla 'Mental HealthBench'i geliştirdiğini ve GPT-6 Astra’nın 57,3 puan aldığını bildirdi. Haberde değerlendirme ölçütleri arasında güvenlik, bağlama uygunluk, kullanıcı özerkliği ve uygulanabilir yönlendirme yer aldı.

Buna karşın OpenAI’ın yayımladığı sistem kartında 'Mental HealthBench' yerine HealthBench bulunuyor. Ayrı haberde yer alan 80’den fazla uzman katılımı, 22 ülke, -1 ile +10 arasındaki puanlama ölçeği ve önceki modele kıyasla üstünlük gibi ayrıntılar da OpenAI’ın resmi materyallerinde doğrulanmıyor.

HealthBench puanları uzunluğa göre ayarlanmış yöntemle hesaplandı. OpenAI, HealthBench Professional puanının GPT-5.6 Sol’dan 4,2 puan yüksek olduğunu, HealthBench genel puanının 1,3 puan, HealthBench Hard puanının ise 3,5 puan arttığını açıkladı.

Bu nedenle HealthBench’teki 58,3 puan ile Mental HealthBench’teki 57,3 puan doğrudan karşılaştırılamaz. Değerlendirme adları, puanlama sistemleri ve incelenen modeller farklı olabilir.

OpenAI, ruh sağlığı, duygusal bağımlılık ve kendine zarar verme konularında çok turlu diyalog değerlendirmesi de yaptığını açıkladı. Bu yöntem, tek bir sabit soruya verilen yanıtı değerlendirmek yerine modelin yanıtına göre diyaloğun devam ettiği durumları esas aldı.

Değerlendirmede düşmanca kullanıcı simülasyonlarından yararlanıldı. Güvenlik politikasını ihlal etmeyen yanıtların oranı 'safe' göstergesiyle hesaplandı. OpenAI, GPT-6 Astra’nın üç alanda GPT-5.6 Sol’a kıyasla iyileşme gösterdiğini belirtti.

Ancak değerlendirme örnekleri, önceki modelin ideal yanıt veremediği zor vakalar temel alınarak oluşturuldu. OpenAI, bu sonuçların gerçek kullanım ortamındaki hata oranını ifade etmediğini de ekledi.

HealthBench, sağlıkla ilgili diyaloglarda acil durumlara müdahale, bağlamı doğrulama ve uzmanlık düzeyine uygun iletişim gibi unsurları değerlendiriyor. Doktorlar, acil tıbbi müdahale gerekip gerekmediğini ve gerektiğinde yanıtın başında açık bir acil yardım tavsiyesi verilip verilmediğini inceledi.

HealthBench araştırması, modelin gerekli bağlamı yeterince doğrulaması ve belirsizliği yönetmesi konusunda gelişime açık alanlar bulunduğuna işaret etti. Bu durum, ruh sağlığı diyaloglarında yalnızca tek bir puana değil, krizleri tespit etme ve diyalog sürecinin güvenliğine de bakılması gerektiğini gösteriyor.

Amerikan Psikiyatri Birliği, 2026 tarihli araştırmasında yetişkinlerin yüzde 17’sinin ruh sağlığı sorunları hakkında yapay zekâ sohbet botlarıyla konuştuğunu açıkladı. Katılımcıların yüzde 35’i, zorluk yaşadıklarında ruh sağlığı uzmanı yerine yapay zekâ sohbet botuyla konuşmaya istekli olduğunu söyledi.

Buna karşılık yüzde 58’i, çocukların ruh sağlığı danışmanlığında yapay zekâ sohbet botlarının kullanılmasından endişe duydu. Amerikan Psikiyatri Birliği, yapay zekânın klinik değerlendirme veya profesyonel ruh sağlığı tedavisinin yerini alamayacağı görüşünde.

OpenAI, GPT-6 Astra’yı 3 Eylül’de tanıttı. Şirket, modelin bilgisayar kullanımı, yazılım mühendisliği, bilim ve siber güvenlik alanlarında performansını artırdığını açıkladı. Ayrıca GPT-6 Astra için kademeli ücretli hizmet ve geliştirici API’si sunumu da başlatıldı.

Resmi sistem kartında şu anda doğrulanabilenler HealthBench puanları ile ruh sağlığı, duygusal bağımlılık ve kendine zarar verme konularındaki çok turlu diyalog değerlendirmesiyle sınırlı. 'Mental HealthBench 57,3 puan' sonucu, ilgili değerlendirmenin metodolojisi ve kaynak verileri yayımlanana kadar OpenAI’ın resmi sonucu olarak kesin biçimde nitelendirilemez.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1