Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

21 araştırmacı 'görsel genel zekâ'yı AGI araştırma gündemine taşıdı

Bir robot kameranın geometrik nesneleri incelediği laboratuvar / TokenPost.ai

Google DeepMind ve Harvard Üniversitesi'nden araştırmacıların da aralarında bulunduğu 21 kişilik bir ekip, görsel deneyimi yapay genel zekâ (AGI) araştırmalarının temel yollarından biri olarak ele alan bir beyaz kitap yayımladı. Beyaz kitapta belirli bir model ya da AGI'ye ulaşılacak bir tarih öne sürülmüyor.

Hirokatsu Kataoka önderliğindeki araştırma ekibi, 26 Ağustos'ta 'Visual General Intelligence: A White Paper' başlıklı çalışmayı yayımladı. Yazar listesinde Google DeepMind araştırmacısı Robert Geirhos ve Harvard Üniversitesi araştırmacısı Yilun Du de yer alıyor.

Beyaz kitapta ortaya konan 'görsel genel zekâ' (VGI) kavramı tek bir modeli ya da mimariyi ifade etmiyor. Görüntü, video ve geometrik verilere dayanarak tahmin, üretim, yeniden yapılandırma, mekânsal anlama ve eylem yeteneklerinin öğrenilmesini hedefleyen bir araştırma yönünü tanımlıyor.

Araştırmacılar, dil odaklı AGI çalışmalarının metin tahmini yoluyla genelleme yeteneğini nasıl genişlettiğini hatırlatarak, benzer bir zekânın görsel verilerden de ortaya çıkıp çıkamayacağını soruyor. Ekibe göre görsel bilgi; nesnelerin biçimi, mekânsal ilişkiler, hareket ve fiziksel yapı gibi dilin açıkça ifade edemediği türden bilgiler içeriyor.

Beyaz kitap, görsel zekâyı yalnızca görüntü tanımayla sınırlamıyor. Gelecekteki durumların tahmin edilmesi, görünmeyen yapıların yeniden kurulması, üç boyutlu mekânın temsil edilmesi ve yeni ortamlarda sürekli öğrenme de araştırma konuları arasında sayılıyor.

Bir robotun çevresini gözlemleyip harekete geçmesi ve elde ettiği sonucu yeniden öğrenme sürecine dahil etmesi anlamına gelen bedenlenmiş zekâ ile aktif algı da tartışılan konular arasında yer alıyor. Bu da araştırma kapsamının, görsel bilginin yalnızca sınıflandırılmasının ötesine geçerek gerçek ortamla etkileşimi de içerecek şekilde genişlediği anlamına geliyor.

Bu, dilin devre dışı bırakılması gerektiği yönünde bir iddia değil. Araştırmacılar, görsel algıyı merkeze alırken dil, işitme, dokunma ve özdurum algısını (proprioception) birleştiren çok modlu bir yaklaşımı da öneriyor.

Google DeepMind araştırmacısı Robert Geirhos, beyaz kitapta "Üretken video modelleri görsel bir temel model haline gelecek" ifadesini kullandı. Bu, üretken video modellerinin tek bir görevi yerine getiren araçların ötesine geçerek birçok görsel görevi işleyebilen bir temel modele dönüşebileceğine dair bir araştırma bakış açısını yansıtıyor.

Ancak bu açıklama, doğrulanmış bir ürün performansını ya da sektörde varılmış bir mutabakatı ifade etmiyor. Beyaz kitapta üretken video modellerinin performans verileri ya da ürün lansman planları yer almıyor.

Beyaz kitap, VGI'nin tanımı, kıyaslama (benchmark) yöntemleri, öğrenme biçimi ile görsel algı ve dil arasındaki ilişkinin henüz tek bir çerçevede toplanmadığını da belirtiyor. Çalışmada, yalnızca görsel deneyimle AGI'ye ulaşılabileceğine dair ampirik bir bulgu da bulunmuyor.

Bu tartışma, Haziran 2026'da düzenlenen CVPR 2026 VGI çalıştayından yola çıktı. CVPR'nin resmi programında 'Visual General Intelligence' başlıklı bir çalıştay yer alırken, Google Research'ün etkinlik duyurusunda da Geirhos'un yönettiği VGI oturumuna değinildi.

Google DeepMind daha önce AGI'yi performans, genellik ve özerklik açısından sınıflandıran bir çerçeveyi ve AGI sonrasında süper zekâya uzanan yolu tartışmıştı. Google DeepMind'ın AGI araştırmaları, performans, genellik ve özerklik ölçütleri etrafında süren tartışmalara da zemin hazırlamıştı.

Bu yeni beyaz kitap, söz konusu araştırma çizgisini görsel deneyim ve fiziksel dünyayı anlama perspektifiyle genişleten bir belge niteliği taşıyor. Üretken video, mekânsal yapay zekâ, robot öğrenimi ve dünya modeli (world model) araştırmalarıyla bağlantılı olabilir; ancak somut bir ticarileşme takvimi sunulmuyor.

Google DeepMind daha önce, AGI sonrasında süper zekâya uzanan bir yol olarak özyinelemeli (recursive) kendini geliştirme olasılığını da gündeme getirmişti. AGI sonrasında özyinelemeli kendini geliştirme olasılığı, sektördeki araştırma ve yatırım tartışmalarında daha önce de dile getirilmişti.

Şu an itibarıyla VGI, tamamlanmış bir teknoloji ya da ürün değil; görsel öğrenmenin genel zekâya nasıl dönüşebileceğinin koşullarını araştıran bir çalışma gündemi. Beyaz kitapta model lansman takvimi, AGI'ye ulaşılacak tarih ya da performans üstünlüğüne dair herhangi bir bilgi bulunmuyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1