Uzun süreli görevler yürüten yapay zekâ (AI) ajanlarının Terminal-Bench 2.0 performansı, yalnızca ihtiyaç duyulan anlarda bellek enjekte eden yapı kullanıldığında 8,3 puan arttı. Bu yöntemde ayrı bir bellek ajanı, görev sırasında kritik bilgileri yönetiyor ve davranış ajanının rotadan sapma ya da aynı hatayı tekrarlama ihtimali ortaya çıktığında müdahale ediyor.
‘Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents’ başlıklı makale, davranış ajanından ayrı çalışan bir bellek ajanı öneriyor. Bellek ajanı, son görev kayıtlarını inceleyerek gereksinimleri, ortam bilgilerini, geçmiş başarısızlıkları ve mevcut ilerleme durumunu yapılandırılmış bir bellek bankasında düzenliyor.
Araştırmacılar, uzun süreli görevlerde karar vermek için gerekli bilgiler sohbet kayıtlarında bulunsa bile sonraki davranışları yeterince kontrol edememe durumunu ‘behavioral state decay’ olarak tanımladı. Çalışma, çok miktarda bilgi depolamak yerine davranışa yeniden müdahale edilecek zamanı belirlemeye odaklandı.
Davranış ajanı olarak Claude Sonnet 4.5’in kullanıldığı deneyde Terminal-Bench 2.0 pass@1 sonucu yüzde 37,6’dan yüzde 45,9’a çıkarak 8,3 puan yükseldi. τ²-Bench görev ağırlıklı ortalaması da yüzde 55,0’dan yüzde 61,8’e çıkarak 6,8 puan iyileşti.
Claude Opus 4.6’nın kullanıldığı deneyde de Terminal-Bench 2.0 sonucu yüzde 43,5’ten yüzde 45,9’a yükseldi. τ²-Bench sonucu ise yüzde 66,2’den yüzde 68,7’ye çıktı.
Terminal-Bench 2.0 sonuçları, toplam 89 görev arasından her iki değerlendirmenin de geçerli olduğu 85 görev temel alınarak hesaplandı. Araştırmacıların sunduğu performans verileri yalnızca bu iki kıyaslama deneyleriyle sınırlı.
Yöntemin temel özelliği, belleği her aşamada görünür kılmamak. Bellek ajanı istikrarlı gerçekleri ve gereksinimleri, geçmiş denemeleri ve başarısızlıkları, mevcut ilerleme durumunu yönetiyor; davranış ajanı normal çalıştığında ise müdahale etmiyor.
Davranış ajanının rotadan sapma ya da aynı hatayı tekrarlama ihtimali olduğunda yalnızca kısa bir bildirim gönderiliyor. Araştırmacılar, tüm belleği her seferinde görünür kılmaktan veya her aşamada bildirim göndermektense seçici müdahalenin daha etkili olduğunu belirtti.
Mevcut yapay zekâ ajanı bellek yöntemleri çoğu zaman bilgileri depolamaya veya kullanıcı talebine göre aramaya odaklanıyor. Bu çalışma ise mevcut davranış modelini değiştirmeden ayrı bir bellek ajanı eklenebileceğini öne çıkarıyor.
Çalışma, uzun süre çalışan yapay zekâ ajanlarının e-posta gönderme, takvim yönetimi ve seyahat rezervasyonu gibi çok aşamalı görevlere genişlediği bir dönemde yayımlandı. Meta(META), 8 Eylül’de kişisel yapay zekâ ajanı Muse’u tanıttı.
Muse, özel bir sanal makinede tarayıcı ve bağlantılı uygulamaları kullanarak çok aşamalı görevleri yerine getirecek şekilde tasarlandı. Meta, Muse’un kullanıcının hedefi doğrultusunda plan oluşturduğunu ve görevi sürdürdüğünü açıkladı.
Muse’un harici hizmetlere erişimi, ayrı bir Sentinel sistemi tarafından onaylanıyor veya reddediliyor; gerektiğinde kullanıcıdan doğrulama isteniyor. Meta, kullanıcının parolaları ve kimlik doğrulama bilgilerinin ajana doğrudan görünmediğini belirtti.
Ancak Meta’nın resmi Muse duyurusu ve güvenlik belgelerinde Muse’un bu makaledeki Proactive Memory Agent’ı kullandığına dair bilgi yer almıyor. Crypto Briefing iki teknoloji arasındaki bağlantıya değinse de resmi kaynaklarda doğrudan entegrasyon doğrulanmadı.
Yapay zekâ ajanlarının uzun süreli belleğini doğrulama ve yönetme çalışmaları daha önce Microsoft’un yapay zekâ belleğini doğruladıktan sonra geçiş oranını yüzde 39’dan yüzde 73’e çıkardığını aktaran örnekte de ele alınmıştı. Bu makale, belleği depolamadan önce doğrulamak yerine görev sırasında müdahale zamanını seçen yapıya odaklanıyor.
Bu makalede ve Muse’ta kripto para cüzdanı yönetimi ya da zincir üstü otomasyon uygulamalarına yer verilmedi. Araştırma sonuçlarının gerçek ticari hizmetlerde aynı düzeyde tekrarlanıp tekrarlanamayacağı ek doğrulama gerektiriyor.
Yorum 0