ИИтак

← Назад

Модель · Qwen

Qwen-VL OCR

Узкая модель Qwen для распознавания текста на сканах, таблицах и чеках. Устаревает: лаборатория советует более новую Qwen3.5-OCR

вышла 28 октября 2024

Характеристики

Вышла
28 октября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
34 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 4,1 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,72 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,72 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen-vl-ocr

Что это за модель

Qwen-VL OCR — модель линейки Qwen для оптического распознавания текста (OCR), то есть для перевода изображения документа в текст. Она принимает картинку или PDF и возвращает текст или структурированные данные. Первая версия вышла в октябре 2024 года. Имя в API указывает на стабильную версию, и лаборатория её обновляет: по документации, последний снимок построен на архитектуре Qwen3-VL. Снимок от ноября 2025 года, по словам компании, заметно лучше разбирает документы и находит на них текст, быстрее отвечает и реже галлюцинирует, то есть реже выдумывает текст, которого на картинке нет.

Обычные модели Qwen-VL понимают изображения в целом. Эта модель заточена под одну задачу — вытаскивать текст. Для этого в ней есть готовые режимы: распознавание текста с координатами каждого фрагмента, извлечение нужных полей из чеков и справок, разбор таблиц в HTML, перевод документов и формул в LaTeX и обычное распознавание текста. Ещё она сама выравнивает перекошенные сканы. Документация показывает примеры на многих языках, среди них русский, китайский, английский, французский, турецкий и иврит.

Модель берут, чтобы оцифровать сканы, разобрать счета и чеки, вытащить таблицы и формулы из статей и превратить PDF в размеченный текст. PDF-файл может весить до 100 МБ. В режиме разбора документа модель обрабатывает до 50 страниц, в обычном распознавании — до 10.

У модели есть ограничения. У картинки есть нижний и верхний предел по числу пикселей. Встроенные режимы работают только через собственный набор инструментов Alibaba, а при подключении через OpenAI-совместимый интерфейс их приходится заменять своими запросами. Ранние снимки, включая исходную версию 2024 года, лаборатория прямо называет слабыми и не рекомендует. Сейчас компания советует брать более новую Qwen3.5-OCR.

Источники: Документация Qwen-OCR в Alibaba Cloud Model Studio

Другие модели семейства

Данные: models.dev (MIT).