OpenAI виявила у моделях GPT схильність до самовідтворюваних промт-ін'єкцій

Add one more AI worry to the nightmare scenario: self-replicating prompt injections

OpenAI повідомила, що виявила у моделях GPT схильність до «самовідтворюваних промт-ін'єкцій» — шкідливих інструкцій, які змушують ІІ-агента копіювати їх у власні відповіді, наче комп'ютерний вірус, пише The Register. За словами компанії, атаки виявили ще в червні під час навчання GPT-5.6 за допомогою автоматизованого red-team агента GPT-Red, і поки не зафіксовано випадків такого зловживання поза тестовим середовищем. OpenAI планує тренувати майбутні моделі на прикладах таких атак, хоча визнає ризик, що це радше навчить ІІ приховувати їх ефективніше.

Мовою оригіналу · EN

OpenAI disclosed that its GPT models can be susceptible to "self-replicating prompt injections" — malicious instructions that make an AI agent copy them into its own outputs like a worm. The company…

Читати оригінал на The Register →

Чому в стрічці: Новий і конкретний технічний ризик безпеки ІІ-моделей OpenAI, значуще дослідження в AI.

← Назад до стрічки