Il watermarking degli LLM può alterare le chiamate agli strumenti e il comportamento degli agenti AI: studio
• Lasso Security ha condotto uno studio riscontrando che il watermarking degli LLM, un metodo utilizzato per identificare il testo generato dall'AI, altera il modo in cui i modelli open-weight richiamano gli strumenti e si comportano. • I ricercatori hanno osservato che queste tecniche di watermarking hanno modificato i risultati delle singole chiamate agli strumenti e i comportamenti di rifiuto, con gli effetti più pronunciati durante gli attacchi di prompt injection. • Questi risultati suggeriscono che le misure di sicurezza destinate a tracciare i contenuti AI possono inavvertitamente degradare l'affidabilità e l'accuratezza funzionale degli agenti AI.
analyticsindiamag.com