Дослідники запропонували архітектуру LLM, що генерує ваги з живих даних сесії

Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

Дослідники представили архітектуру Infinite-Parameter LLM, у якій компактна гіпермережа перетворює дані, отримані під час взаємодії з користувачем, на низькорангову модуляцію ваг базової мережі — замість того, щоб тримати їх лише в контекстному вікні. На відміну від попередніх генераторів ваг, система підтримує байєсівську оцінку прихованого коду й оновлює її онлайн у міру діалогу, тож ваги переобчислюються з урахуванням нової інформації, а не фіксуються після першого прочитання. За словами авторів, такий підхід дає змогу моделі «пам'ятати» факти та виправлення користувача між сеансами, економити обчислення та звільняти контекстне вікно порівняно з класичним in-context навчанням чи retrieval.

Мовою оригіналу · EN

Researchers propose the Infinite-Parameter LLM, where a compact hypernetwork turns run-time interaction data into a low-rank modulation of a shared base network's feed-forward weights, rather than…

Читати оригінал на Hacker News (100+ балів) →

Чому в стрічці: Новий підхід до архітектури LLM із живим навчанням ваг — у фокусі профілю користувача на frontier-capability AI.

← Назад до стрічки