Модель · Sarvam AI
Sarvam Vision 2.1
Модель Sarvam AI для чтения документов: анкеты, многостраничные таблицы и рукописи на английском и 22 языках Индии
вышла 24 сентября
Характеристики
- Вышла
- 24 сентября
- Понимает
- изображения, PDF
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- —
- Идентификатор в API
- sarvam-vision-2.1
Что это за модель
Sarvam Vision 2.1 — модель индийской компании Sarvam AI для чтения документов. Она переводит сканы и фотографии страниц в текст, извлекает поля из анкет и разбирает таблицы. Модель читает английский и 22 официальных языка Индии. В основе лежит визуально-языковая модель, то есть нейросеть, которая понимает и изображение, и текст. Вокруг неё компания построила обвязку: один модуль размечает макет страницы, а отдельная сеть решает, в каком порядке читать блоки. Модель работает и с отдельной страницей, и с документом целиком.
Первая Sarvam Vision вышла в феврале 2026 года. В версии 2.1 появились разбор сложных таблиц, растянутых на несколько страниц, извлечение пар «поле — значение» из форм и распознавание рукописного текста на индийских языках. Компания заявляет, что модель стала реже допускать галлюцинации (выдумывать текст, которого нет на странице) и несогласованные ответы. Кроме того, Sarvam переработала инференс — запуск модели на своих серверах. По словам компании, теперь доступ стоит дешевле, чем обещали при выходе первой версии, а API подходит для рабочей среды.
По замерам компании, на тесте olmOCR-Bench, где сложные PDF нужно перевести в разметку Markdown, модель набрала 87,3%. Это больше, чем у Claude Opus 5 (85,1%), Gemini 3.6 Flash (82,4%) и GPT-6 Astra (81,8%). На OmniDocBench v1.6 у неё 94,97 балла: чуть меньше, чем у PaddleOCR-VL 1.6 (96,01), но больше, чем у GLM-OCR и GPT-6 Astra. Для индийских языков Sarvam собрала собственный тест Sarvam Indic OCR Bench из 6909 образцов: газет, брошюр, учебников и исторических текстов. По данным компании, на нём модель показала 87,39%, у Bodhan Indic-OCR — 84,94%, у Gemini 3.6 Flash — 79,35%.
Модель доступна через два API. Digitize превращает многостраничный документ в структурированный текст, а таблицы отдаёт в HTML, Markdown или JSON. Extract возвращает поля, которые пользователь сам перечислил в схеме, в виде JSON, CSV или таблицы Excel. Ещё модель можно попробовать в тестовой среде личного кабинета и в агентах Akshar — системе, где результат проверяет и правит человек. Модель узкая: она читает документы, но не ведёт разговор и не пишет тексты. По документации API, в одном файле может быть не больше 10 страниц, а запросов — не больше 10 в минуту. Sarvam и сама оговаривается, что высокий балл на бенчмарке не всегда значит, что модель так же хороша в реальной работе.
Источники: Анонс Sarvam Vision 2.1 в блоге Sarvam AI, Документация Document AI: Digitize и Extract, Страница модели Sarvam Vision в документации
Новости о модели
- 01
Данные: models.dev (MIT).