Дослідники представили Dust — метод передтренування трансформерів без зворотного поширення помилки

Dust: Pretraining Transformers Without Backpropagation

Дослідники Q Labs розробили алгоритм Dust — перший метод нульового порядку, який конкурує з класичним зворотним поширенням помилки (backprop) у передтренуванні трансформерних мовних моделей. За словами авторів, при великих популяціях Dust навіть перевершує backprop і на кілька порядків ефективніший за інші еволюційні стратегії оптимізації. Дослідники також зазначають, що більші моделі виявилися ефективнішими в пошуку, що суперечить поширеній думці про масштабованість таких методів.

Мовою оригіналу · EN

We present the first zeroth-order method that is competitive with backprop at pretraining transformer language models.

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Потенційно значущий технічний прорив в AI-дослідженнях — сильна відповідність до AI-лінії інтересів.

← Назад до стрічки