Індустрія ШІ визнає: механізм «відмови» моделей залишається ненадійним запобіжником
We’re putting too much faith in AI’s ability to say no
Провідні компанії зі штучного інтелекту, зокрема Anthropic і OpenAI, покладаються на механізм «відмови» як головний запобіжник від шкідливих запитів ШІ, пише MIT Technology Review. Дослідники визнають, що принципи ухвалення моделями таких рішень вивчені погано, а зловмисники регулярно обходять захист через «джейлбрейки». Видання попереджає, що авторитарні уряди можуть використати цей самий механізм для цензурування небажаної інформації.
Мовою оригіналу · EN
AI companies rely on refusal as the core safety mechanism, but it remains poorly understood and easy to jailbreak.
Читати оригінал на MIT Technology Review →
Чому в стрічці: Глибокий аналіз ризиків безпеки ШІ — ключова тема інтересів користувача.