Il watermarking degli LLM può alterare le chiamate agli strumenti e il comportamento degli agenti AI: studio
• Lasso Security ha condotto uno studio riscontrando che il watermarking degli LLM, un metodo utilizzato per identificare il testo generato dall'AI, altera il modo in cui i modelli open-weight richiamano gli strumenti e si comportano. • I ricercatori hanno osservato che queste tecniche di watermarking hanno modificato i risultati delle singole chiamate agli strumenti e i comportamenti di rifiuto, con gli effetti più pronunciati durante gli attacchi di prompt injection. • Questi risultati suggeriscono che le misure di sicurezza destinate a tracciare i contenuti AI possono inavvertitamente degradare l'affidabilità e l'accuratezza funzionale degli agenti AI.
analyticsindiamag.com
![[AINews] GPT-6 Astra: il lancio del più grande LLM di sempre di OpenAI](/_next/image?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!75mH!%2Cw_1200%2Ch_675%2Cc_fill%2Cf_jpg%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Cg_auto%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F3e58156f-49e2-48e8-af49-ce5edd8e68b6_1118x1118.png&w=1920&q=85)










