AllenAI випустив Olmo-core 3 — відкриту інфраструктуру для навчання великих MoE-моделей
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs

Дослідницька лабораторія AllenAI представила Olmo-core 3 — оновлену відкриту інфраструктуру для навчання великих мовних моделей типу «суміш експертів» (MoE), розраховану на масштабування до трильйона параметрів. За даними компанії, нова система підвищила пропускну здатність навчання приблизно у 2,7 раза порівняно з попередньою реалізацією на базі FSDP. Інфраструктуру протестували на моделі з 1,2 трильйона параметрів на 512 GPU NVIDIA B300.
Мовою оригіналу · EN
AllenAI released Olmo-core 3, an open training infrastructure for scaling mixture-of-experts (MoE) models toward the trillion-parameter range. The company reported up to 2.7x higher throughput…
Читати оригінал на Hugging Face →
Чому в стрічці: Технічний реліз відкритої AI-інфраструктури з конкретними показниками — відповідає інтересу до названих AI-розробок.