ИИтак

← Назад

Модель · Cohere

Aya Vision 32B

Открытая исследовательская модель Cohere для вопросов по картинкам и чтения текста на фото на 23 языках, старшая в линейке Aya Vision

вышла 4 марта 2025

Характеристики

Вышла
4 марта 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
16 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 4 тыс. токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
c4ai-aya-vision-32b

Что это за модель

Aya Vision 32B — модель, которая понимает изображения и отвечает на вопросы о них текстом. Её выпустило Cohere Labs, исследовательское подразделение Cohere, вместе с младшей версией Aya Vision 8B. Модель собрана из двух частей: языковой модели Aya Expanse 32B и кодировщика изображений SigLIP2, которые связывает дополнительный слой-адаптер. Картинку модель режет на фрагменты, чтобы разглядеть мелкие детали и текст.

Главное отличие линейки — многоязычность. Модель обучали на 23 языках, среди них русский, китайский, японский, арабский и хинди. Большинство открытых моделей для работы с картинками хорошо работают в основном на английском. Лаборатория переводила обучающие данные на все 23 языка и потом переписывала переводы, чтобы текст звучал естественно. Ещё она объединила готовую модель с исходной языковой моделью. По её словам, это прибавило 11,9% на многоязычных тестах.

Модель берут для описания изображений, чтения текста на фото и сканах (OCR, оптическое распознавание символов), разбора графиков, ответов на вопросы по картинке и рассуждений о ней. По замерам лаборатории, в попарных сравнениях с более крупными Llama 3.2 90B Vision, Molmo 72B и Qwen2.5-VL 72B она побеждает в 50–64% случаев на собственном тесте Cohere AyaVisionBench и в 52–72% на многоязычном m-WildVision. Победителя в этих сравнениях определяла другая нейросеть-судья, а не люди. AyaVisionBench лаборатория сделала сама: в нём 9 типов задач на 23 языках.

Веса открыты, но лицензия CC-BY-NC разрешает только некоммерческое использование, и нужно соблюдать правила допустимого использования Cohere Labs. Для работы в бизнесе у Cohere есть отдельная модель Command A Vision. Кроме того, 32 миллиарда параметров требуют мощного оборудования. Качество ответов зависит от языка и типа задачи.

Источники: Карточка модели на Hugging Face, Анонс Aya Vision (блог на Hugging Face), Анонс Aya Vision в блоге Cohere

Данные: models.dev (MIT).