Модель · Cohere
Aya Vision 32B
Открытая исследовательская модель Cohere для вопросов по картинкам и чтения текста на фото на 23 языках, старшая в линейке Aya Vision
вышла 4 марта 2025
Характеристики
- Вышла
- 4 марта 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 16 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4 тыс. токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- c4ai-aya-vision-32b
Что это за модель
Aya Vision 32B — модель, которая понимает изображения и отвечает на вопросы о них текстом. Её выпустило Cohere Labs, исследовательское подразделение Cohere, вместе с младшей версией Aya Vision 8B. Модель собрана из двух частей: языковой модели Aya Expanse 32B и кодировщика изображений SigLIP2, которые связывает дополнительный слой-адаптер. Картинку модель режет на фрагменты, чтобы разглядеть мелкие детали и текст.
Главное отличие линейки — многоязычность. Модель обучали на 23 языках, среди них русский, китайский, японский, арабский и хинди. Большинство открытых моделей для работы с картинками хорошо работают в основном на английском. Лаборатория переводила обучающие данные на все 23 языка и потом переписывала переводы, чтобы текст звучал естественно. Ещё она объединила готовую модель с исходной языковой моделью. По её словам, это прибавило 11,9% на многоязычных тестах.
Модель берут для описания изображений, чтения текста на фото и сканах (OCR, оптическое распознавание символов), разбора графиков, ответов на вопросы по картинке и рассуждений о ней. По замерам лаборатории, в попарных сравнениях с более крупными Llama 3.2 90B Vision, Molmo 72B и Qwen2.5-VL 72B она побеждает в 50–64% случаев на собственном тесте Cohere AyaVisionBench и в 52–72% на многоязычном m-WildVision. Победителя в этих сравнениях определяла другая нейросеть-судья, а не люди. AyaVisionBench лаборатория сделала сама: в нём 9 типов задач на 23 языках.
Веса открыты, но лицензия CC-BY-NC разрешает только некоммерческое использование, и нужно соблюдать правила допустимого использования Cohere Labs. Для работы в бизнесе у Cohere есть отдельная модель Command A Vision. Кроме того, 32 миллиарда параметров требуют мощного оборудования. Качество ответов зависит от языка и типа задачи.
Источники: Карточка модели на Hugging Face, Анонс Aya Vision (блог на Hugging Face), Анонс Aya Vision в блоге Cohere
Данные: models.dev (MIT).