Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

Perplexity, araç çağrısı hata oranını yüzde 21,2 düşürdü

Araç çağrısı hatasını yeniden çalıştıran el ve dizüstü bilgisayar / TokenPost.ai

Perplexity, gerçek kullanıcı oturumlarında ortaya çıkan hataları ve kullanıcı düzeltmelerini model eğitimine dahil ederek araç çağrısı hata oranını yüzde 2,24'ten yüzde 1,77'ye indirdi. Göreli düşüş yüzde 21,2 oldu.

Perplexity, 21'inde araştırma blogunda yayımladığı 'Learning from Real-World Mistakes' başlıklı yazıda, iki ardışık eğitim kontrol noktasını karşılaştıran çevrim içi A/B testi sonuçlarını açıkladı. Söz konusu oranlar, temel model GLM 5.2 ile sonraki kontrol noktasının doğrudan karşılaştırılmasına dayanmıyor.

Bu eğitim yöntemi, yalnızca başarılı oturumları taklit edecek şekilde eğitilen reddedilmiş örnekleme ile ince ayarın (RFT) sınırlamalarını gidermeye odaklandı. Başarılı oturumlardan geçerli eylemler öğrenilirken, başarısız oturumlardan kullanıcı düzeltmeleri ve araç hataları üzerinden düzeltilmesi gereken noktalar çıkarıldı.

Düzeltme aşamasında on-policy öz damıtma (OPSD) uygulandı. Aynı model öğretmen ve öğrenci rollerini üstlenirken, yalnızca öğretmen modele hatanın nedenini açıklayan kısa bir ipucu verildi. Öğrenci model, ipucunu görmeden öğretmen modelin sonraki belirteç tahminlerini öğrendi.

Perplexity ayrıca araç hatası görülen 985 oturumun ayrı olarak yeniden oluşturulduğu bir deneyi sundu. İpucu verildiğinde mevcut hatadan kaçınma oranı yüzde 75,1'den yüzde 93,7'ye, düzeltilmiş eylemi fiilen gerçekleştirme oranı ise yüzde 60,6'dan yüzde 82,3'e yükseldi.

Ancak bu deney, hatadan kaçınma becerisini ölçüyor. Hatadan kaçınma, tek başına başarılı araç çağrısı veya genel görev başarısı anlamına gelmiyor.

Çevrim dışı değerlendirmede temel GLM 5.2'nin araç hata oranı yüzde 2,79, yalnızca RFT uygulanan kontrol noktasının oranı yüzde 1,35, RFT ve OPSD'nin birlikte uygulandığı kontrol noktasının oranı ise yüzde 0,87 olarak ölçüldü. Perplexity, her kontrol noktasının eğitim verileri farklı olduğu için bunun yalnızca OPSD'nin kontrol edildiği bir deney olmadığını belirtti.

Görev bazındaki performans da tüm ölçütlerde tutarlı biçimde iyileşmedi. Bu nedenle yalnızca çevrim dışı oranlara dayanarak OPSD'nin araç hata oranını düşürmedeki etkisini bağımsız biçimde kesinleştirmek mümkün değil.

Çevrim içi deney iki kez gerçekleştirildi. İlk deneyde ilk RFT ve OPSD kontrol noktasının araç hata oranı yüzde 2,82 ile GLM 5.2'nin yüzde 2,94'lük oranının altında kaldı ancak fark istatistiksel olarak anlamlı değildi.

Yalnızca sonraki iki RFT ve OPSD kontrol noktasının karşılaştırıldığı deneyde yüzde 2,24'ten yüzde 1,77'ye anlamlı bir düşüş tespit edildi. Sonraki kontrol noktası ile GLM 5.2'nin doğrudan karşılaştırıldığı sonuçlar açıklanmadı.

Kullanıcı memnuniyetindeki iyileşme de istatistiksel olarak doğrulanmadı. Sonraki deneyde orta ve üzeri düzeyde memnuniyetsizlik olasılığı önceki kontrol noktasında yüzde 2,58 iken sonraki kontrol noktasında yüzde 2,54'e geriledi ancak fark anlamlı değildi.

İlgili DART-SD çalışması da çok aşamalı araç çağrısı süreçlerinde, doğru biçimde tamamlanan bölümlerin tamamının yeniden eğitilmesinin etkili keşif davranışını bozabileceğine işaret etti. Çalışma, hatanın başladığı eşik noktasından sonraki kurtarma aşamasının seçici biçimde öğrenilmesini önerdi ancak Perplexity'nin deneyiyle aynı yöntemi veya modeli kullanmadı.

Yapay zekâ ajanları arama, arama sonuçlarını yorumlama ve harici API çağrısı gibi birden fazla aracı art arda kullanıyor. Bu süreçte hatalı biçimlendirilmiş talepler veya araç yanıtlarının yanlış anlaşılması nihai yanıtta hatalara yol açabilir. Gereksiz araç çağrıları ise hesaplama maliyetini ve yanıt gecikmesini artırabilir.

Bu yapıda ajanın tüm araçları aynı anda çağırmak yerine ihtiyaç duyduğu araçları bulup çağırması da önem taşıyor. Daha önce Yapay zekâ ajanlarının yalnızca ihtiyaç duyduğu araçları çağırma yöntemi tanıtıldığı gibi, araç bağlantıları ve hata kurtarma süreçleri modelin yanıt üretme becerisinden ayrı yönetilmesi gereken konular haline geldi.

Reddit'teki Perplexity topluluğunda bazı kullanıcılar, uzun süren aramaların ardından araç çağrılarının durduğunu veya hata verdiğini bildirdi. Bu, münferit kullanıcı deneyimlerine dayanıyor ve Perplexity'nin açıkladığı genel kullanıcı grubuna ait istatistiklerle doğrudan ilişkilendirilemez.

Sonuçlar, yapay zekâ ajanlarının eğitiminde yalnızca nihai yanıtın başarılı olup olmadığının değil, arama ve harici araç çağrısı sırasında oluşan hataların da eğitim sinyali olarak kullanılabileceğini gösteriyor. Ancak açıklanan veriler yalnızca araç çağrısı güvenilirliğindeki iyileşmeyi destekliyor; kullanıcı memnuniyetinin veya genel görev başarı oranının da arttığı sonucuna varmak için yeterli kanıt bulunmuyor.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1