Дослідники Lasso Security виявили, що водяні знаки ШІ-контенту змінюють поведінку агентів
AI model watermarking changes agent behavior
Компанія Lasso Security встановила, що обов'язкові за вимогами Акту ЄС про ШІ водяні знаки в згенерованому контенті — зокрема технологія SynthID-Text від Google DeepMind, яку використовують Anthropic та OpenAI — змінюють спосіб вибору моделлю наступних слів, що впливає на роботу з інструментами та відмови в небезпечних запитах. За даними дослідників, точність виклику інструментів знизилася у шести з семи протестованих моделей, а під час атак із впровадженням підказок (prompt injection) ефект на відмови ставав відчутнішим. Lasso наголошує, що це не привід відмовлятися від водяних знаків, але вимагає враховувати їх у тестуванні безпеки ШІ-агентів.
Мовою оригіналу · EN
Lasso Security found that AI content watermarking required under the EU AI Act — including Google DeepMind's SynthID-Text, used by Anthropic and OpenAI — alters how models choose tokens, affecting…
Читати оригінал на The Register →
Чому в стрічці: Пряме продовження теми контролю та безпеки агентного ШІ, яка домінує в інтересах користувача.