Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Yapay zeka ajanı rekabetinde odak, model performansından kurumsal sistemlere kayıyor

Şirket içi onay sürecini kontrol eden bir dizüstü bilgisayar ekranı / TokenPost.ai

Yapay zeka ajanları rekabetinin ağırlık merkezi, bilgisayarı yönetme becerisinden kurumsal iş süreçlerine güvenle entegre edilebilecek işletim sistemlerine doğru kayıyor. Uzmanlara göre gerçek görevleri bir ajana devretmek için yalnızca model performansı yeterli değil; şirkete özgü bağlam, yetki yönetimi, hata kurtarma ve doğrulama mekanizmalarının birlikte kurulması gerekiyor.

Andreessen Horowitz, 28 Ağustos 2025'te (yerel saatle) yayımladığı yazıda, bilgisayar kullanan ajanların tarayıcı ve masaüstü ortamlarını doğrudan yöneterek iş otomasyonunun kapsamını genişlettiğini aktardı. Şirkete göre kurumsal sahada belirleyici olan artık genel amaçlı modelin kendisi değil; şirkete özgü bağlam, güvenilirlik tasarımı ve uzun süreli görevleri koordine eden orkestrasyon yapısı.

Bilgisayar kullanan ajanlar, insanın gördüğü ekranı algılayıp tıklama, veri girişi ve sayfa geçişi gibi işlemleri kendi başına yürüten yapay zeka sistemleri. Bir hedef aldıktan sonra gereken aracı seçip birden fazla adımı art arda tamamlayabilmeleri, önceden tanımlanmış adımları tekrarlayan klasik robotik süreç otomasyonundan (RPA) ayrıldıkları nokta.

Bu tür ajanların hedeflendiği alanlar; belge arama, müşteri ilişkileri yönetimi sistemine veri girişi, şirket içi mesajlaşma bildirimleri ve rapor hazırlama gibi birden fazla programı aynı anda kullanan işler. Kurumsal iş süreçlerinde erişim yetkisi, istisna yönetimi, denetim kaydı ve insan onayı gibi adımlar iç içe geçtiği için sadece ekranı kullanabilmek, sürecin tamamını otomatikleştirmeye yetmiyor.

OSWorld'ün resmi makalesine göre 369 gerçek bilgisayar görevinde insan başarı oranı yüzde 72,36 olurken, o dönemki en iyi model yüzde 12,24'te kaldı. OSWorld, gerçek işletim sistemi ortamında dosya, uygulama ve web sayfalarıyla etkileşim becerisini ölçen bir karşılaştırma standardı (benchmark).

OpenAI, 23 Ocak 2025'te (yerel saatle) duyurduğu Bilgisayar Kullanan Ajan'ın (Computer-Using Agent, CUA) OSWorld'de yüzde 38,1, WebArena'da yüzde 58,1 ve WebVoyager'da yüzde 87 başarı oranına ulaştığını açıkladı. Bu rakamlar, bilgisayarı doğrudan kullanan modellerin araştırma aşamasını geride bırakıp ürünleşme sürecine girdiğini gösteriyor.

Yine de aynı bilgisayar kullanım becerisi ölçülse bile benchmark sürümü, görev kurgusu ve çalıştırma altyapısı farklıysa sonuçları doğrudan kıyaslamak zorlaşıyor. Orijinal makale, OSWorld-Verified ve şirketlerin kendi yeniden değerlendirmeleri farklı koşullar uyguladığından, performans rakamlarının hangi ölçüt üzerinden alındığı da ayrıca belirtilmeli.

Kurumsal yapay zeka ajanlarındaki tıkanıklığın yalnızca model skoruyla açıklanamamasının nedeni de burada yatıyor. Güçlü bir model elde edilse bile gereken bağlamı zamanında sağlayacak, çalışma sonucunu doğrulayacak ve başarısız görevleri kurtaracak bir sistem yoksa üretim ortamında istikrarlı çalışma sağlamak güçleşiyor.

Microsoft(MSFT), 2 Haziran'da (yerel saatle) yayımladığı yazıda şirketlerin ihtiyaç duyduğu şeyin sadece güçlü bir model ya da işlem gücü olmadığını, ajanları kurup devreye alan, izleyen ve denetleyen bir sistem olduğunu belirtti. Bağlam, yönetişim, gözlemlenebilirlik ve sürekli iyileştirmeyi üretim ortamına geçişin başlıca koşulları olarak sıraladı.

OpenAI de 25 Haziran'da (yerel saatle) yayımladığı yazıda ajan kullanım biçiminin tek seferlik sorgulardan uzun süreli işleri devretme yönüne kaydığını aktardı. Görev süresi uzadıkça ara sonuçların doğrulanması, yetkilerin sınırlandırılması ve başarısızlık durumunda işi insana devreden sürecin önemi de artıyor.

Güvenlik, kurumsal ajanların çözmesi gereken bir başka başlık. Ajanlar iç belgeleri ve iş sistemlerini okuyup yazabilir hale geldikçe, gereken bağlamı kullanma becerisiyle birlikte hassas bilginin dışarı sızma riski de büyüyor.

Microsoft Research'ün CI-Work araştırması, kurumsal büyük dil modeli (LLM) ajanlarında gizlilik ihlali oranını yüzde 15,8 ila 50,9, bilgi sızıntısı oranını ise en fazla yüzde 26,7 olarak ortaya koydu. Araştırmacılar, model boyutunu veya çıkarım derinliğini artırmanın tek başına bağlama bağlı bilgi sızıntısı sorununu çözmediği sonucuna vardı.

Sektörde ekran ve tarayıcı üzerinden çalışan ajanları mevcut yazılımlarla bağlantı kurmak için geçici bir yöntem olarak görenler var; ajanların insanlar gibi mevcut araçları doğrudan kullanmasının asıl yöntem haline geleceğini savunanlar da var. İki görüş de gerçek kullanımda erişim kontrolü, koruma kuralları (guardrail) ve sonuç doğrulamasının şart olduğu noktasında birleşiyor.

Şirketlerin kendi bünyesinde ajan çalıştırma yapıları kurma girişimleri de sürüyor. Coinbase'in şirket içi yapay zeka sistemi bulut sanal alanı (cloud sandbox), alt ajan koordinasyonu ve otomatik görev oluşturma yapısını kullanıyor; bu tarz sistem tasarımları, modelin çok adımlı işleri yürütürken yetki ve sorumluluk sınırlarını ayırmasının temelini oluşturuyor.

Kripto para alanında yapay zeka ajanlarının fiyat üzerindeki olası etkisinden çok kimlik, yetki ve denetim yapısının nasıl kurulacağı doğrudan gündeme geliyor. Otonom işlem yapan yapay zeka ajanlarının kimliğini ve yetki sınırlarını doğrulayan ortak bir araştırma da başladı; ajanlar kurumsal iş süreçlerine ve dijital varlık altyapısına ne kadar çok girerse denetim sisteminin önemi de o kadar artıyor.

Doğrulama kaynakları: Andreessen Horowitz, OSWorld, OpenAI CUA, OpenAI Agents, Microsoft Blog, Microsoft Research.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1