Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

AI filigranı sonrası zararlı yanıtlar ve araç çağrıları değişebiliyor

AI ajanlarının araç çağrısı deneyi / TokenPost.ai

LLM’lere AI filigranı uygulanması, yalnızca olağan cümle seçimlerini değil, zararlı taleplerin reddedilmesini ve AI ajanlarının araç çağrılarını da değiştirebiliyor. Bazı açık ağırlıklı modellerde filigran uygulandıktan sonra zararlı taleplere yanıt verme olasılığı arttı.

Lasso Security, 17’sinde yayımladığı araştırmada Google DeepMind’ın SynthID-Text yöntemini açık ağırlıklı modellere uygulayarak davranış değişikliklerini karşılaştırdı. Deneyde aynı model ve komut kullanıldı; yalnızca filigranın uygulanıp uygulanmadığı değiştirildi.

Andrea Siposova (Andrea Siposova) Lasso Security araştırmacısı, “Filigran, düşmanca koşullarda veya bir ajan araç çağırdığında model davranışını açıkça değiştiriyor” dedi. Görünür olmayan işaretin üretim sonucuna eklenmesi sürecinin, modelin token seçimlerini de etkileyebileceğini belirtti.

SynthID-Text, üretim tamamlandıktan sonra ayrı bir bilgi ekleyen bir yöntem değil. Modelin sonraki tokenı seçme sürecinde gizli anahtar ve turnuva örneklemesi kullanarak istatistiksel bir örüntü bırakıyor.

Model, birden fazla aday tokenın olasılığını karşılaştırarak sonraki kelimeyi seçiyor. Filigran bu sürece dahil olduğunda aynı komut ve model kullanılsa bile seçim sonucu anahtara bağlı olarak değişebiliyor.

Olağan cümlelerde bu değişiklikler birkaç kelimenin farklılaşmasıyla sınırlı kalabilir. Ancak AI ajanlarının JSON formatında araç adı ve argüman değerleri ürettiği ortamlarda yalnızca araç seçimi değil, yol, alıcı, arama terimi ve miktar gibi argümanlar da değişebilir.

Lasso Security, araç çağrısı değerlendirmesinde BFCL v4 tek turlu AST’yi kullandı. Filigran uygulandıktan sonra araç çağrısı doğruluğu yedi modelin altısında düştü. Dört modeldeki düşüş istatistiksel olarak anlamlı bulundu.

Filigran öncesi ve sonrası çağrı sonuçlarının değiştiği oran, 21 model-sıcaklık kombinasyonunda ortalama yüzde 6,5 oldu. Bazı koşullarda phi-4 çağrılarının yüzde 16,8’i, Llama-3.1-8B çağrılarının ise yüzde 9,9’u değişti.

Zararlı taleplerin reddedilmesine yönelik deneyde HarmBench’in 200 zararlı davranışı ile JailbreakBench’in 100 normal talebi kullanıldı. Araştırmacılar yalnızca zararlı taleplerin sunulduğu durumları, sabit bir komut enjeksiyonunun eklendiği durumlarla karşılaştırdı. Filigranın reddetme davranışı üzerindeki etkisi, komut enjeksiyonu eklendiğinde daha büyük oldu.

Araştırmacılar bu olguyu ‘sampling drift’ olarak adlandırdı. Bu ifade, filigranın model ağırlıklarını veya komutu değiştirmediği halde token seçimini değiştirerek model yanıtlarını ve ajan davranışlarını farklılaştırabileceği anlamına geliyor.

Ancak araştırmada Claude modelleri test edilmedi. Deney kapsamına altı açık ağırlıklı model alındı ve Hugging Face’in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor uygulaması kullanıldı.

Anthropic, 14 Ağustos’ta gelecekte Claude modellerine Google DeepMind’ın SynthID-Text tabanlı metin filigranını uygulayacağını açıkladı. Şirket, filigranın çıktı kalitesi veya okunabilirliği üzerinde somut bir etkisi olmayacağını ve okuyucular tarafından fark edilemeyeceğini belirtti.

Google DeepMind’ın araştırmasında, yaklaşık 20 milyon Gemini yanıtı kullanılarak yapılan değerlendirmede filigrandan kaynaklanan bir kalite düşüşü gözlemlenmediği bildirildi. Ortalama cümle kalitesinin korunması ile belirli komut, anahtar ve model koşullarında tekil çalıştırmaların değişebilmesi aynı anda mümkün olabilir.

AI ajanlarının dış araçları çağırdığı ortamlarda yalnızca model yanıtlarının değil, yetkilerin ve yürütme yollarının da yönetilmesi gerekiyor. Komut enjeksiyonu ile araç çağrılarının birlikte kontrol edilmesi gerektiğine yönelik değerlendirmeler, kurumsal AI güvenlik kontrollerinin model yanıtlarıyla dış araç yetkilerini birlikte ele alması gerektiğine ilişkin görüşlerle de örtüşüyor.

Avrupa Birliği AI Act’in 50. maddesinin 2. fıkrası, sentetik metin, görüntü, ses ve video üreten sistem sağlayıcılarının çıktıları makine tarafından okunabilir biçimde işaretlemesini ve bunların AI tarafından üretildiğinin tespit edilebilmesini zorunlu kılıyor. Filigran kullanımının yaygınlaşması halinde bile model bazındaki uygulamalar ve güvenlik etkileri ayrıca doğrulanmalı.

Bu araştırma, filigranın tüm modellerde ve tüm anahtarlarda güvenlik önlemlerini zayıflattığı anlamına gelmiyor. Çalışma, model, anahtar ve komut koşullarına göre davranış değişiklikleri görülebileceğini ortaya koydu; ancak aktif olarak kullanılan bir ajanın zararlı bir aracı çalıştırması sonucunda oluşacak zararı kanıtlamadı. LLM filigranları ile sanal varlıklar veya blokzincir arasında doğrudan bir bağlantı da doğrulanmadı.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1