ИИтак

← Назад

Модель · Cohere

Command A Vision

Модель Cohere на основе Command A, которая понимает картинки: читает документы, сканы, графики и таблицы

вышла 31 июля 2025

Характеристики

Вышла
31 июля 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$2,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
июнь 2024
Идентификатор в API
command-a-vision-07-2025

Что это за модель

Command A Vision — первая коммерческая модель Cohere, которая понимает не только текст, но и изображения. Внутри у неё языковая модель Command A и визуальный кодировщик SigLIP2 (модуль, который переводит картинку в понятный языковой модели вид). Всего в ней 112 млрд параметров, и все они работают на каждом шаге: это плотная модель, а не смесь экспертов. Картинку она режет на части размером до 12 фрагментов по 512×512 точек и добавляет к ним уменьшенную копию всего изображения. Одна картинка занимает до 3328 токенов.

От Command A она отличается тем, что видит изображения, а текстовые навыки базовой модели, по словам Cohere, в основном сохранила. От более ранних Aya Vision 8B и 32B её отличает направленность: Aya — исследовательская линейка с упором на много языков, а Command A Vision сделана для бизнес-задач. Официально модель поддерживает шесть языков: английский, португальский, итальянский, французский, немецкий и испанский.

Её берут, чтобы разбирать документы: распознавать текст на сканах и фотографиях, читать графики, таблицы и схемы, искать нужное в инструкциях к продуктам. В одном запросе можно передать до 20 картинок. По замерам Cohere, модель в среднем обходит GPT-4.1, Llama 4 Maverick и Mistral Medium на девяти тестах по зрению. Например, в DocVQA (вопросы по документам) у неё 95,9%, в ChartQA (вопросы по графикам) — 90,9%, в OCRBench (распознавание текста) — 86,9%. Для запуска на своём оборудовании компания называет две видеокарты A100 или одну H100, если сжать веса до 4 бит.

Веса открыты, но лицензия CC-BY-NC разрешает только некоммерческое использование: для коммерческого нужно договариваться с Cohere. В открытой версии контекст по умолчанию — 32 тысячи токенов, до 128 тысяч его расширяют в настройках. Создатели советуют подавать картинки не больше 3 мегапикселей. Ответы модель даёт только текстом, картинки она не рисует.

Источники: Анонс Command A Vision на Hugging Face, Карточка модели на Hugging Face, Заметка о выпуске в документации Cohere

Другие модели семейства

Данные: models.dev (MIT).