Studi: Watermarking LLM Dapat Mengubah Pemanggilan Alat dan Perilaku Agen AI
β’ Lasso Security melakukan studi yang menemukan bahwa watermarking LLM, sebuah metode yang digunakan untuk mengidentifikasi teks buatan AI, mengubah cara model open-weight memanggil alat dan berperilaku. β’ Para peneliti mengamati bahwa teknik watermarking ini mengubah hasil pemanggilan alat secara individual dan perilaku penolakan, dengan efek yang paling nyata terjadi selama serangan prompt injection. β’ Temuan ini menunjukkan bahwa langkah-langkah keamanan yang dimaksudkan untuk melacak konten AI dapat secara tidak sengaja menurunkan keandalan dan akurasi fungsional dari agen AI.
analyticsindiamag.com

