Дослідник Anthropic показав, як автоматизована система покращує вирівнювання ШІ

An Anthropic researcher just gave us a peek at self-improving AI

Дослідник програми Anthropic Fellows опублікував працю, що демонструє автоматизовану систему, яка самостійно покращила показники вирівнювання (alignment) моделі за всіма 10 тестовими бенчмарками без погіршення загальної продуктивності. За словами авторів, найкращий автоматизований метод у середньому вже за шість годин випереджає пропозиції досвідчених дослідників-людей, а коштує близько $4 на годину проти $150 для людини. Автори називають це раннім свідченням того, що автоматизоване пост-тренування з вирівнювання може стати практичним у найближчому майбутньому.

Мовою оригіналу · EN

A researcher in Anthropic's fellows program published a paper showing an automated AI system that reliably improved model performance on all 10 alignment benchmarks tested without degrading overall…

Читати оригінал на TechCrunch →

Чому в стрічці: Пряме попадання в core-інтерес AI: конкретний приклад автоматизованого дослідження вирівнювання моделей.

← Назад до стрічки