Модель · Cohere
Command A Vision
Модель Cohere на основе Command A, которая понимает картинки: читает документы, сканы, графики и таблицы
вышла 31 июля 2025
Характеристики
- Вышла
- 31 июля 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 128 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 8 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $2,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $10 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- июнь 2024
- Идентификатор в API
- command-a-vision-07-2025
Что это за модель
Command A Vision — первая коммерческая модель Cohere, которая понимает не только текст, но и изображения. Внутри у неё языковая модель Command A и визуальный кодировщик SigLIP2 (модуль, который переводит картинку в понятный языковой модели вид). Всего в ней 112 млрд параметров, и все они работают на каждом шаге: это плотная модель, а не смесь экспертов. Картинку она режет на части размером до 12 фрагментов по 512×512 точек и добавляет к ним уменьшенную копию всего изображения. Одна картинка занимает до 3328 токенов.
От Command A она отличается тем, что видит изображения, а текстовые навыки базовой модели, по словам Cohere, в основном сохранила. От более ранних Aya Vision 8B и 32B её отличает направленность: Aya — исследовательская линейка с упором на много языков, а Command A Vision сделана для бизнес-задач. Официально модель поддерживает шесть языков: английский, португальский, итальянский, французский, немецкий и испанский.
Её берут, чтобы разбирать документы: распознавать текст на сканах и фотографиях, читать графики, таблицы и схемы, искать нужное в инструкциях к продуктам. В одном запросе можно передать до 20 картинок. По замерам Cohere, модель в среднем обходит GPT-4.1, Llama 4 Maverick и Mistral Medium на девяти тестах по зрению. Например, в DocVQA (вопросы по документам) у неё 95,9%, в ChartQA (вопросы по графикам) — 90,9%, в OCRBench (распознавание текста) — 86,9%. Для запуска на своём оборудовании компания называет две видеокарты A100 или одну H100, если сжать веса до 4 бит.
Веса открыты, но лицензия CC-BY-NC разрешает только некоммерческое использование: для коммерческого нужно договариваться с Cohere. В открытой версии контекст по умолчанию — 32 тысячи токенов, до 128 тысяч его расширяют в настройках. Создатели советуют подавать картинки не больше 3 мегапикселей. Ответы модель даёт только текстом, картинки она не рисует.
Источники: Анонс Command A Vision на Hugging Face, Карточка модели на Hugging Face, Заметка о выпуске в документации Cohere
Другие модели семейства
-
Command A Plus
Cohereконтекст 128 тыс.$2,50 / $10открытые весарассуждения
-
Command A Translate
Cohereконтекст 8 тыс.$2,50 / $10открытые веса
-
Command A Reasoning
Cohereконтекст 256 тыс.$2,50 / $10открытые весарассуждения
Данные: models.dev (MIT).