Microsoft($MSFT) araştırmacıları, AI ajanlarının uzun vadeli hafızasını kaydetmeden önce gerçek ortamda doğrulayan bir yöntem sundu. Makaledeki deneyde veritabanı keşif görevinde başarı oranı yüzde 39'dan yüzde 73'e yükseldi, sorgu başına görev ajanı maliyeti ise 3,38 dolardan 1,68 dolara düştü.
Microsoft araştırmacıları, 10'unda yayımladıkları 'Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents' başlıklı makalede bu yöntemi 'ortam keşifli hafıza düzenleme' olarak tanımladı. Yapı, aday hafızayı kaydetmeden önce ayrı bir düzenleme ajanının veritabanı ve dosyalar gibi gerçek ortamı yalnızca okuma yetkisiyle sorgulayarak olgu ve uygulama kapsamını doğrulamasına dayanıyor. Makalenin orijinali
Mevcut yöntemde, görev tamamlandıktan sonra düzenleme ajanı, görev sürecinde elde edilen bilgilere dayanarak 'öğrenilenleri' uzun vadeli hafızaya kaydediyor. Araştırmacıların dile getirdiği sorun, bu sırada yanlış yorumların, yalnızca bazı durumlara uyan kuralların veya ortam değişikliği nedeniyle güncelliğini yitirmiş bilgilerin olduğu gibi kaydedilebilmesi.
Ortam keşifli yöntemde ise düzenleme ajanı önce aday hafızayı oluşturuyor, ardından gerçek ortamı sorguluyor. Doğrulama sonucuna göre hafıza kaydediliyor veya düzenleniyor, uygulama kapsamı daraltılıyor ya da hafıza siliniyor. Düzenleme ajanına, çalışma ortamını değiştirebilecek yazma yetkisi verilmiyor.
Araştırmacılar, bu yöntemin mevcut görev ajanı, arama motoru ve hafıza kayıt formatının değiştirilmesini ya da modelin yeniden eğitilmesini gerektirmediğini açıkladı. Doğrulama aşamasına yalnızca minimum yetkiye sahip, salt okunur bir araç eklemek yeterli.
Deney, GitHub Copilot SDK kullanılarak oluşturulan, gerçek çalışma ortamına benzer bir ortamda yürütüldü. Ortam keşifli hafıza, CLBench veritabanı keşif görevine uygulandığında başarı oranı yüzde 39'dan yüzde 73'e, ödül puanı ise 8,60'tan 22,60'a yükseldi. Sorgu başına arama sayısı 8,8'den 4,7'ye düştü.
Görev ajanının sorgu başına maliyeti 3,38 dolardan 1,68 dolara indi. Basit hesaplamayla bu yaklaşık yüzde 50,3'lük bir düşüşe denk geliyor, ancak düzenleme ajanının ayrı çağrı maliyeti, görev ajanı maliyetinden bağımsız olarak hesaplandı. Dolayısıyla bu durum, şirketin toplam işletme maliyetinin aynı oranda azaldığı anlamına gelmiyor.
Araştırmacılar, 6 farklı ortamda 90 yönetim danışmanlığı görevini de ek olarak değerlendirdi. Ortam keşifli hafıza, 6 ortamdan 5'inde mevcut hafıza yöntemine kıyasla maliyet başına ödül performansında daha yüksek sonuç verdi; görev ajanının araç çağırma sayısı ise göreve bağlı olarak yüzde 16 ila 75 arasında azaldı.
Sonnet 4.6 ve Opus 4.7 kullanılarak yapılan karşılaştırmada da ortam keşifli hafıza, mevcut hafıza yöntemine göre daha yüksek ortalama ödül kaydetti. Ancak deneyler büyük ölçüde GitHub Copilot tabanlı sınırlı bir ortamda, CLBench ve APEX görevleri odaklı olarak gerçekleştirildi.
Bu yöntemin özü, hafıza miktarını artırmak değil. Asıl amaç, ajanın görev sırasında elde ettiği bilgiyi doğrudan genelleştirmek yerine, gerçek verilerle karşılaştırdıktan sonra uzun vadeli hafızaya aktarma aşamasına bir doğrulama adımı eklemek.
Salt okunur sorgulama, veritabanı veya dosyaları değiştirmeden aday hafızanın olgusunu ve uygulama kapsamını doğrulama yöntemi. Bunu kurumsal ortamlarda uygulayabilmek için sorgulanan hedef ile erişim yetkisinin ayrılması ve doğrulama sürecinde hangi bilginin teyit edildiğinin kayıt altına alınması gerekiyor.
Doğrulama aşaması eklendiğinde, görev ajanının araç çağırma sayısı veya yeniden yapılan işler azalabilir. Öte yandan arka planda çalışan düzenleme ajanının çağrı maliyeti ortaya çıktığından, uygulamanın etkisi değerlendirilirken görev maliyeti ile doğrulama maliyetinin birlikte hesaplanması gerekiyor.
Microsoft daha önce, AI ajanlarının hafıza performansını 450 kurumsal görevle değerlendiren STATE-Bench'i duyurmuştu. Bu kıyaslama, müşteri desteği, seyahat ve alışveriş alanlarında süreç uyumu, durum değişikliği ve işlem maliyetini birlikte ölçüyor. STATE-Bench tanıtımı
Bir başka araştırma projesi olan Memora ise saklanan bilgi ile arama yöntemini birbirinden ayırarak, uzun vadeli görevlerde gereken bağlam token sayısını en fazla yüzde 98 azaltan bir hafıza yapısı sundu. Microsoft Research açıklaması Bu makale, hafızanın temsil biçiminden çok, kayıt öncesi doğrulama sürecine odaklanması yönüyle Memora'dan ayrılıyor.
Bu araştırma, gazetemizin AI ajanları arasındaki rekabetin model performansından kurumsal sistemlere kaydığına dair önceki haberiyle de bağlantılı. Ancak sınırlı deney ortamının dışında aynı doğruluk ve maliyet verimliliğinin tekrarlanıp tekrarlanamayacağı için ek doğrulama gerekiyor.
Yorum 0