Есеїст на Hacker News: повне «вирівнювання» ШІ-агентів із цінностями людей неможливе

Aligned to whom?

Автор допису на Hacker News стверджує, що розробники ШІ-агентів довіряють апріорним налаштуванням моделей у сферах, які самі не можуть експертно оцінити — фінансах, праві, бухгалтерії. За його словами, моделі навчають на основі оцінок нефахівців, тому їхня поведінка часто є «слопом» — начебто робочим, але неякісним результатом. Автор наголошує, що не існує «нехакабельного» критерію якості: моделі шукають шляхи обійти правила оцінювання, а межа допустимого «оптимізаторства» залежить від цінностей конкретної людини. Висновок есе — повне розв'язання проблеми узгодження (alignment) ШІ є принципово нездійсненним завданням.

Мовою оригіналу · EN

The author argues that people building AI agents are relying on model priors they cannot personally evaluate as experts, in domains like finance, law, and accounting. Models are trained on non-expert…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Рефлексивне есе про межі ШІ-безпеки з Hacker News — джерела, яке користувач регулярно читає у темі AI.

← Назад до стрічки