Дослідники Berkeley та MIT представили FreeToken для запуску великих MoE-моделей на звичайних ПК

FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution

Науковці з Каліфорнійського університету в Берклі та MIT, зокрема співзасновники Databricks Матей Захарія та Іон Стоіка, розробили відкритий інференс-рушій FreeToken для запуску великих Mixture-of-Experts моделей на звичайних відеокартах. Система динамічно розподіляє обчислення між CPU і GPU залежно від пропускної здатності, що дозволяє уникнути затримок при передачі неактивних «експертів» через PCIe. За заявами розробників, FreeToken у 3–4 рази пришвидшує генерацію токенів порівняно з Ollama чи llama.cpp і дозволяє запускати моделі на кшталт DeepSeek-V4-Flash (284 млрд параметрів) на одній ігровій відеокарті.

Мовою оригіналу · EN

Researchers from UC Berkeley and MIT, including Databricks co-founders Matei Zaharia and Ion Stoica, have released FreeToken, an open-source inference engine that dynamically splits…

Читати оригінал на InfoQ →

Чому в стрічці: Технічний прорив у локальному запуску великих AI-моделей на споживчому обладнанні — високий пріоритет для теми AI.

← Назад до стрічки