ИИтак

← Назад

Sarvam AI выпустила модель Sarvam Vision 2.1 для распознавания документов

По замерам компании, модель лидирует в англоязычном тесте olmOCR-Bench и в тесте на 22 языках Индии. В тесте OmniDocBench, который проверяет структуру документов, она уступает только модели-конкуренту PaddleOCR-VL 1.6.

Изображение: Sarvam AI

Индийская компания Sarvam AI выпустила Sarvam Vision 2.1 — модель, которая переводит сканы и фотографии документов в текст, говорится в блоге компании. Новая версия научилась распознавать рукописный текст на языках Индии. Она также извлекает поля и их значения из анкет и многостраничных таблиц. Доступ к модели через API подешевел по сравнению с ценой, объявленной при первом запуске.

«Как правило, лучшая на английских бенчмарках модель плохо справляется с индийскими языками», — отмечают разработчики. По их словам, Sarvam Vision 2.1 показывает лучший результат и в англоязычном тесте, и в собственном тесте компании для языков Индии.

Sarvam AI основана в Бангалоре в 2023 году. Правительство Индии выбрало её, чтобы создать первую национальную большую языковую модель в рамках государственной программы IndiaAI Mission.

Sarvam Vision — визуально-языковая модель: на вход она получает изображение страницы, на выходе выдаёт текст. Работает модель в связке с двумя вспомогательными системами. Одна размечает страницу на смысловые блоки, другая определяет, в каком порядке их читать. Модель может разбирать страницу и целиком, но с вспомогательными системами результат точнее, пояснили в компании.

Для обучения Sarvam сгенерировала большой объём рукописных и печатных анкет на разных языках. Кроме того, компания брала реальные бланки из интернета и заполняла их автоматически. Образцы индийского почерка собирали в том числе из видео. Затем модель дообучили на размеченных примерах, а после — методом обучения с подкреплением с проверяемыми вознаграждениями1. По словам компании, в новой версии устранены главные слабые места прошлой — галлюцинации и непоследовательные ответы.

В тесте olmOCR-Bench2 модель набрала 87,3 балла. У Claude Opus 5 — 85,1, у GPT-6 Astra — 81,8. В OmniDocBench v1.63, который проверяет, насколько точно передана структура документа, Sarvam Vision 2.1 вторая с 94,97 балла. Первое место у PaddleOCR-VL 1.64 с 96,01 балла. Все замеры провела сама Sarvam.

Компания подчёркивает, что по сочетанию двух тестов модель находится на Парето-фронте. Это значит, что среди проверенных систем нет ни одной, которая превзошла бы её сразу в обоих.

Вместе с моделью Sarvam выложила на Hugging Face собственный тест Sarvam Indic OCR Bench. В нём 6 909 образцов: 6 609 на 22 официальных языках Индии и 300 на английском. Тексты взяты из газет, учебников, брошюр и исторических документов начиная с 1800 года. Sarvam Vision 2.1 распознала их с точностью 87,39%. У Gemini 3.6 Flash — 79,35%, у Claude Opus 5 — 68,81%.

Модель доступна через два API. Digitize переводит многостраничные документы, таблицы и рукописи в структурированный текст, Extract извлекает из них поля, таблицы и пары «ключ — значение». Насколько снизилась цена, компания не уточнила.

Первую версию Sarvam Vision компания выпустила в феврале 2026 года в линейке своих суверенных моделей. Уже тогда она специализировалась на распознавании текста на языках Индии и разборе таблиц.

← Все новости