AllenAI випустив Olmo-core 3 — відкриту інфраструктуру для навчання великих MoE-моделей

Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs

Дослідницька лабораторія AllenAI представила Olmo-core 3 — оновлену відкриту інфраструктуру для навчання великих мовних моделей типу «суміш експертів» (MoE), розраховану на масштабування до трильйона параметрів. За даними компанії, нова система підвищила пропускну здатність навчання приблизно у 2,7 раза порівняно з попередньою реалізацією на базі FSDP. Інфраструктуру протестували на моделі з 1,2 трильйона параметрів на 512 GPU NVIDIA B300.

Мовою оригіналу · EN

AllenAI released Olmo-core 3, an open training infrastructure for scaling mixture-of-experts (MoE) models toward the trillion-parameter range. The company reported up to 2.7x higher throughput…

Читати оригінал на Hugging Face →

Чому в стрічці: Технічний реліз відкритої AI-інфраструктури з конкретними показниками — відповідає інтересу до названих AI-розробок.

← Назад до стрічки