Studi: Watermarking LLM Dapat Mengubah Pemanggilan Alat dan Perilaku Agen AI
• Lasso Security melakukan studi yang menemukan bahwa watermarking LLM, sebuah metode yang digunakan untuk mengidentifikasi teks buatan AI, mengubah cara model open-weight memanggil alat dan berperilaku. • Para peneliti mengamati bahwa teknik watermarking ini mengubah hasil pemanggilan alat secara individual dan perilaku penolakan, dengan efek yang paling nyata terjadi selama serangan prompt injection. • Temuan ini menunjukkan bahwa langkah-langkah keamanan yang dimaksudkan untuk melacak konten AI dapat secara tidak sengaja menurunkan keandalan dan akurasi fungsional dari agen AI.
analyticsindiamag.com









