Hugging Face випустив NeoMME — багатомовний мультимодальний енкодер для пошуку документів
NeoMME: an efficient Multimodal-native and Multilingual Encoder

Дослідники Hugging Face представили сімейство мультимодальних енкодерів NeoMME на 260 та 800 млн параметрів, які обробляють текст і зображення одним трансформером без окремої зорової вежі. За даними компанії, модель NeoMME-Retriever для пошуку сторінок документів працює приблизно вдвічі швидше за ColModernVBERT і скорочує обсяг пошукового індексу до 255 разів. Усі контрольні точки моделі випущені у відкритому доступі за ліцензією Apache 2.0.
Мовою оригіналу · EN
Hugging Face introduced NeoMME, a family of 260M and 800M multilingual multimodal encoders that process text and images with a single bidirectional Transformer instead of a separate vision tower…
Читати оригінал на Hugging Face →
Чому в стрічці: Конкретний технічний реліз AI-моделі у відкритому доступі — відповідає інтересу до практичних розробок у сфері AI.