Дослідники запропонували архітектуру LLM, що генерує ваги з живих даних сесії
Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

Дослідники представили архітектуру Infinite-Parameter LLM, у якій компактна гіпермережа перетворює дані, отримані під час взаємодії з користувачем, на низькорангову модуляцію ваг базової мережі — замість того, щоб тримати їх лише в контекстному вікні. На відміну від попередніх генераторів ваг, система підтримує байєсівську оцінку прихованого коду й оновлює її онлайн у міру діалогу, тож ваги переобчислюються з урахуванням нової інформації, а не фіксуються після першого прочитання. За словами авторів, такий підхід дає змогу моделі «пам'ятати» факти та виправлення користувача між сеансами, економити обчислення та звільняти контекстне вікно порівняно з класичним in-context навчанням чи retrieval.
Мовою оригіналу · EN
Researchers propose the Infinite-Parameter LLM, where a compact hypernetwork turns run-time interaction data into a low-rank modulation of a shared base network's feed-forward weights, rather than…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: Новий підхід до архітектури LLM із живим навчанням ваг — у фокусі профілю користувача на frontier-capability AI.