Модель · Qwen
Qwen-VL OCR
Узкая модель Qwen для распознавания текста на сканах, таблицах и чеках. Устаревает: лаборатория советует более новую Qwen3.5-OCR
вышла 28 октября 2024
Характеристики
- Вышла
- 28 октября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 34 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4,1 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,72 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,72 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen-vl-ocr
Что это за модель
Qwen-VL OCR — модель линейки Qwen для оптического распознавания текста (OCR), то есть для перевода изображения документа в текст. Она принимает картинку или PDF и возвращает текст или структурированные данные. Первая версия вышла в октябре 2024 года. Имя в API указывает на стабильную версию, и лаборатория её обновляет: по документации, последний снимок построен на архитектуре Qwen3-VL. Снимок от ноября 2025 года, по словам компании, заметно лучше разбирает документы и находит на них текст, быстрее отвечает и реже галлюцинирует, то есть реже выдумывает текст, которого на картинке нет.
Обычные модели Qwen-VL понимают изображения в целом. Эта модель заточена под одну задачу — вытаскивать текст. Для этого в ней есть готовые режимы: распознавание текста с координатами каждого фрагмента, извлечение нужных полей из чеков и справок, разбор таблиц в HTML, перевод документов и формул в LaTeX и обычное распознавание текста. Ещё она сама выравнивает перекошенные сканы. Документация показывает примеры на многих языках, среди них русский, китайский, английский, французский, турецкий и иврит.
Модель берут, чтобы оцифровать сканы, разобрать счета и чеки, вытащить таблицы и формулы из статей и превратить PDF в размеченный текст. PDF-файл может весить до 100 МБ. В режиме разбора документа модель обрабатывает до 50 страниц, в обычном распознавании — до 10.
У модели есть ограничения. У картинки есть нижний и верхний предел по числу пикселей. Встроенные режимы работают только через собственный набор инструментов Alibaba, а при подключении через OpenAI-совместимый интерфейс их приходится заменять своими запросами. Ранние снимки, включая исходную версию 2024 года, лаборатория прямо называет слабыми и не рекомендует. Сейчас компания советует брать более новую Qwen3.5-OCR.
Источники: Документация Qwen-OCR в Alibaba Cloud Model Studio
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).