Індустрія ШІ визнає: механізм «відмови» моделей залишається ненадійним запобіжником

We’re putting too much faith in AI’s ability to say no

Провідні компанії зі штучного інтелекту, зокрема Anthropic і OpenAI, покладаються на механізм «відмови» як головний запобіжник від шкідливих запитів ШІ, пише MIT Technology Review. Дослідники визнають, що принципи ухвалення моделями таких рішень вивчені погано, а зловмисники регулярно обходять захист через «джейлбрейки». Видання попереджає, що авторитарні уряди можуть використати цей самий механізм для цензурування небажаної інформації.

Мовою оригіналу · EN

AI companies rely on refusal as the core safety mechanism, but it remains poorly understood and easy to jailbreak.

Читати оригінал на MIT Technology Review →

Чому в стрічці: Глибокий аналіз ризиків безпеки ШІ — ключова тема інтересів користувача.

← Назад до стрічки