GLM-5.3 tabanlı altyapı ajanı, GLM-5.3-Flash’ın çıkarım sistemini optimize ederek uçtan uca işlem hacmini başlangıç seviyesine kıyasla 3,2 kat artırdı. Ajanın ilk çalıştırılmasından tüm üretim trafiğini üstlenmesine kadar geçen süre iki haftadan kısa oldu.
Zhipu, GLM-5.3 tabanlı altyapı ajanının GLM-5.3-Flash çıkarım sisteminin geliştirilmesine katkı sağladığını açıkladı. BlockBeats, Zhipu’nun açıklamasına dayanarak ajanın kod değişiklikleri, performans kontrolleri ve kök neden analizlerini tekrarlı biçimde yürüttüğünü bildirdi.
Bu vaka, yapay zeka ajanlarının yalnızca kod yazmakla kalmayıp çalıştırma sonuçlarını ölçebildiğini ve sonraki değişiklik yönünü belirleyebildiğini gösteriyor. Performans geliştirme çalışmalarının bir bölümünü otomatikleştiren yapının gerçek üretim ortamına uygulandığı belirtildi.
Tang Jie(Tang Jie) Zhipu ortak kurucusu ve başbilim insanı, ajanın en kolay tıkandığı noktanın kod yazmak değil, sorunun kaynağını bulmak olduğunu söyledi. Bir değişiklik sonrasında işlem hacminin yüzde 20 düştüğü görülebilse de sorunun hangi katmanda ortaya çıktığını ve sonraki kontrolde neye odaklanılması gerektiğini belirlemek için ayrıca analiz yapılması gerekiyor.
Zhipu, deneyimli mühendislerin performans sorunlarını izleme yöntemlerini ajanın kullanabileceği araçlara dönüştürdü. Ajan, kodu değiştirdikten sonra sonucun normal olup olmadığını kontrol etti ve çalışma süresinin hangi bölümde oluştuğunu analiz etti.
Daha sonra farklı seçenekleri karşılaştırarak daha hızlı yöntemi buldu ve kodu yeniden değiştirdi. Yapı, yalnızca tek bir değişikliğin sonucunu incelemek yerine hipotez kurup deney yürütüyor ve sonucu sonraki çalışmaya aktarıyor.
Ajan, uzun bağlam işleme sürecindeki hesaplama hatalarını, KV aktarım darboğazını ve kod çözme çekirdeğindeki yinelenen hesaplama sorununu tespit etti. Bu sorunlardan birinin çözümü için bir çekirdek yeniden yazıldıktan sonra işlem hızı 1,71 kat arttı.
Çekirdek, yapay zeka modelinin hesaplamalarını gerçekleştiren düşük seviyeli kod birimidir. Aynı modelde bile çekirdeğin çalışma yöntemi ve veri aktarım yapısı, çıkarım hızını ve kaynak kullanımını değiştirebilir.
KV aktarımı, çıkarım sırasında oluşturulan ara durum bilgilerinin başka bir işlem aşamasına veya cihaza iletilmesi işlemidir. Bu süreçte darboğaz oluşması, modelin kendi performansından bağımsız olarak toplam yanıt işlem hacmini düşürebilir.
Zhipu daha önce GLM-5.3-Flash’ın çıkarım performansı ve maliyet bilgilerini açıklamıştı. Bu kez öne çıkan nokta, modelin kendi performans verilerinden ziyade modeli hizmete sunan çıkarım sisteminin bir ajan tarafından optimize edilmesi oldu.
Bu tür çalışmalarda insan, hedefleri ve sınırları belirleyerek yüksek riskli değişiklikleri inceliyor. Ajan ise performans düşüşünün nedenini izliyor, hipoteze göre kodu değiştiriyor ve deney yürütüyor.
Tang Jie, mühendislerin rolünün giderek ‘geri bildirim tasarlayan kişi’ rolüne yaklaşacağını söyledi. İnsan denetimiyle ajanın tekrarlı deneylerini birleştiren bu yaklaşımın performans geliştirme döngüsünü kısaltması bekleniyor.
Ancak bu vakayı tam anlamıyla yinelemeli kendi kendine iyileştirme (RSI) olarak değerlendirmek mümkün değil. Tang Jie, modelin sistemi optimize ettiği ve sistemin yeniden modele hizmet verdiği ‘minimum kapalı döngünün’ ortaya çıktığını, ancak bunun tam RSI’dan uzak olduğunu belirtti.
Yorum 0