Модель · H Company
NeoMME
Лёгкий открытый кодировщик H Company для поиска по сканам документов без распознавания текста, основа для своих поисковых систем
вышла 3 сентября
Характеристики
- Вышла
- 3 сентября
- Понимает
- изображения, текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- neomme
Что это за модель
NeoMME — линейка кодировщиков от H Company. Кодировщик не пишет ответы, как чат-бот. Он превращает текст и картинки в векторные представления: наборы чисел, по которым потом можно искать похожее. Моделей две, на 260 и 800 млн параметров. Обе обучены с нуля, без готовых моделей для зрения или текста. Текст и кусочки изображения размером 32×32 пикселя проходят через один общий трансформер, который читает всё сразу, в обе стороны. Отдельного блока для картинок в нём нет.
Главная задача — поиск по документам. Вариант NeoMME-Retriever ищет по страницам как по картинкам. Ему не нужно сначала распознавать текст, поэтому он учитывает вёрстку, таблицы и графики. За один проход он выдаёт два вида векторов. Первый — один вектор на страницу, для быстрого поиска. Второй — много векторов на страницу, для точного сравнения с запросом по частям. На бенчмарке ViDoRe v3 модель на 260 млн параметров, по замерам авторов, набирает nDCG@10 0,523. Это лучший результат среди моделей меньше 800 млн параметров и почти вровень с ColQwen2.5, которая в 14 раз больше. Старшая модель набирает 0,556.
От соседа по размеру, ColModernVBERT, младшая модель отличается скоростью. Авторы пишут, что на видеокарте NVIDIA L40S она обрабатывает около 51 страницы в секунду, вдвое больше, чем ColModernVBERT. Хранить индекс тоже дешевле. После сжатия страница занимает около 6 КБ вместо примерно 1,5 МБ, а качество поиска остаётся выше 95% от исходного. Модели подходят для генерации с поиском, когда языковая модель отвечает по найденным страницам. Их также дообучают под свои задачи через библиотеку Sentence Transformers.
Веса выложены под лицензией Apache 2.0, она разрешает коммерческое использование. Словарь модели строили под 14 языков. Авторы признают, что другие языки из тестового набора FLORES-200 модель понимает хуже. Генерировать текст она умеет только в экспериментальном режиме: делать это её не учили.
Источники: Анонс NeoMME в блоге H Company, Научная статья о NeoMME
Новости о модели
- 01
Данные: models.dev (MIT).