Дослідники: водяні знаки SynthID-Text підвищують вразливість ШІ до шкідливих запитів
LLMs respond differently to harmful prompts when AI watermarking is used

Дослідники компанії Lasso Security виявили, що технологія водяних знаків SynthID-Text, розроблена Google і прийнята Anthropic для майбутніх моделей Claude, змінює не лише вибір слів моделлю, а й її поведінку при виклику інструментів та дотриманні правил безпеки. За словами дослідниці Андреа Сіпосової, за наявності таких водяних знаків моделі частіше виконують шкідливі інструкції, яких зазвичай уникали б, особливо під час атак зловмисників. Це вказує на потребу ретельного тестування ШІ-агентів перед впровадженням маркування, якого вимагає закон ЄС.
Мовою оригіналу · EN
New research from Lasso Security shows that SynthID-Text watermarking, developed by Google and adopted by Anthropic for future Claude models, alters not just word choice but also tool-calling…
Читати оригінал на Ars Technica →
Чому в стрічці: Тема контролю й безпеки ШІ — стійкий інтерес користувача, схоже на популярну історію The Register про водяні знаки.