ИИтак

← Назад

NeoMME: открытый кодировщик на 260 млн параметров ищет по сканам страниц вдвое быстрее аналога

Авторы при поддержке H Company выложили под Apache 2.0 кодировщики NeoMME на 260 и 800 млн параметров. Модель на их основе ищет по страницам документов как по картинкам, без распознавания текста, а её индекс можно сжать в 255 раз.

Изображение: Hugging Face

Для поиска по PDF-документам вышла открытая модель, которой не нужно сначала распознавать текст. NeoMME-Retriever смотрит на страницу как на картинку и сразу превращает её в набор векторов для поиска. Так сохраняются таблицы, графики, вёрстка и шрифты, которые теряются даже при идеальном распознавании. Модели на 260 и 800 млн параметров выложены на Hugging Face под лицензией Apache 2.0.

В основе лежит кодировщик NeoMME. Обычно такие системы собирают из готовых частей: отдельная модель для картинок, переходник и языковая модель, которая пишет текст. Здесь один трансформер читает и слова, и кусочки изображения размером 32×32 пикселя. Его обучили с нуля: он угадывал скрытые слова в тексте, а когда скрыто почти всё, опирался на картинку. Модель держит в памяти 16 384 токена — хватает на два изображения в 4K.

На бенчмарке ViDoRe v3 младшая версия набрала 0,523 по основному показателю — лучший результат среди проверенных моделей меньше 800 млн параметров. От ColQwen2.5 она отстаёт на 0,002, а параметров у неё примерно в 14 раз меньше. Старшая версия набрала 0,556, почти как Vultron Retriever Flash того же размера. На видеокарте NVIDIA L40S модель на 260 млн обрабатывает около 51 страницы в секунду. Это почти вдвое быстрее, чем ColModernVBERT.

Отдельная проблема — объём индекса. Модель хранит вектор для каждого фрагмента страницы, и в среднем выходит около 1,5 МБ на страницу. Авторы объединяют похожие векторы и хранят их грубее. В мягком режиме индекс весит 39 кБ на страницу и сохраняет больше 99% качества. В жёстком — 6 кБ, в 255 раз меньше исходного, при качестве выше 95%.

За один проход модель выдаёт и один компактный вектор на страницу, и подробный набор. Авторы советуют большой архив сначала отфильтровать по короткому вектору, а найденное переупорядочить по подробному. Дообучать модель можно в Sentence Transformers 6, а в демо на Hugging Face есть готовая связка: поиск нужных страниц и ответ по ним визуальной языковой моделью.

Авторы называют проект «побочным квестом двух друзей», который делали при ограниченных времени и мощностях. Вычисления предоставила французская H Company.

← Все новости