ИИтак

← Назад

Модель · Sarvam AI

Sarvam Vision 2.1

Модель Sarvam AI для чтения документов: анкеты, многостраничные таблицы и рукописи на английском и 22 языках Индии

вышла 24 сентября

Характеристики

Вышла
24 сентября
Понимает
изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
—
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
—
ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
—
Идентификатор в API
sarvam-vision-2.1

Что это за модель

Sarvam Vision 2.1 — модель индийской компании Sarvam AI для чтения документов. Она переводит сканы и фотографии страниц в текст, извлекает поля из анкет и разбирает таблицы. Модель читает английский и 22 официальных языка Индии. В основе лежит визуально-языковая модель, то есть нейросеть, которая понимает и изображение, и текст. Вокруг неё компания построила обвязку: один модуль размечает макет страницы, а отдельная сеть решает, в каком порядке читать блоки. Модель работает и с отдельной страницей, и с документом целиком.

Первая Sarvam Vision вышла в феврале 2026 года. В версии 2.1 появились разбор сложных таблиц, растянутых на несколько страниц, извлечение пар «поле — значение» из форм и распознавание рукописного текста на индийских языках. Компания заявляет, что модель стала реже допускать галлюцинации (выдумывать текст, которого нет на странице) и несогласованные ответы. Кроме того, Sarvam переработала инференс — запуск модели на своих серверах. По словам компании, теперь доступ стоит дешевле, чем обещали при выходе первой версии, а API подходит для рабочей среды.

По замерам компании, на тесте olmOCR-Bench, где сложные PDF нужно перевести в разметку Markdown, модель набрала 87,3%. Это больше, чем у Claude Opus 5 (85,1%), Gemini 3.6 Flash (82,4%) и GPT-6 Astra (81,8%). На OmniDocBench v1.6 у неё 94,97 балла: чуть меньше, чем у PaddleOCR-VL 1.6 (96,01), но больше, чем у GLM-OCR и GPT-6 Astra. Для индийских языков Sarvam собрала собственный тест Sarvam Indic OCR Bench из 6909 образцов: газет, брошюр, учебников и исторических текстов. По данным компании, на нём модель показала 87,39%, у Bodhan Indic-OCR — 84,94%, у Gemini 3.6 Flash — 79,35%.

Модель доступна через два API. Digitize превращает многостраничный документ в структурированный текст, а таблицы отдаёт в HTML, Markdown или JSON. Extract возвращает поля, которые пользователь сам перечислил в схеме, в виде JSON, CSV или таблицы Excel. Ещё модель можно попробовать в тестовой среде личного кабинета и в агентах Akshar — системе, где результат проверяет и правит человек. Модель узкая: она читает документы, но не ведёт разговор и не пишет тексты. По документации API, в одном файле может быть не больше 10 страниц, а запросов — не больше 10 в минуту. Sarvam и сама оговаривается, что высокий балл на бенчмарке не всегда значит, что модель так же хороша в реальной работе.

Источники: Анонс Sarvam Vision 2.1 в блоге Sarvam AI, Документация Document AI: Digitize и Extract, Страница модели Sarvam Vision в документации

Новости о модели

  1. 01

    Sarvam выпустила модель Vision 2.1 для чтения документов и рукописей

    Sarvam AI

все упоминания Vision 2.1 — 3 →

Данные: models.dev (MIT).