DeepSeek V4.1 Flash отримав виконання коду на всіх 11 цілях у бенчмарку хакерських навичок ШІ

DeepSeek v4.1 Flash Is Now Our Best Hacking Model

Компанія Enclave AI повідомила, що модель DeepSeek V4.1 Flash досягла виконання коду на всіх 11 вразливих цілях у їхньому бенчмарку хакерських здібностей ШІ, тоді як усі чотири виправлені цілі залишились захищеними. Атаки обійшлися лише у 4,65 долара завдяки кешуванню токенів, а подальший аудит показав, що модель самостійно знайшла кілька непередбачених шляхів атаки на Grafana, Jenkins і Nextcloud. За словами розробників бенчмарку, це змусило посилити перевірку не лише кінцевого результату атаки, а й усього її шляху.

Мовою оригіналу · EN

DeepSeek V4.1 Flash achieved code execution on all 11 vulnerable targets in Enclave's AI hacking benchmark while all four fixed targets remained secure, at a cost of just $4.65 thanks to heavy token…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Про використання ШІ для автономного зламу систем — пряме продовження теми ризиків агентних ШІ, яку користувач активно читає.

← Назад до стрічки