ИИтак

← Назад

Модель · Cohere

Aya Vision 8B

Малая открытая модель Cohere для вопросов по картинкам и распознавания текста на 23 языках, младшая в линейке Aya Vision

вышла 4 марта 2025

Характеристики

Вышла
4 марта 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
16 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 4 тыс. токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
c4ai-aya-vision-8b

Что это за модель

Aya Vision 8B — открытая модель исследовательского подразделения Cohere Labs. Она отвечает текстом на вопросы о картинках. Модель собрана из трёх частей: языковой модели на основе Command R7B, кодировщика изображений SigLIP2 и адаптера, который их связывает. Всего в ней около 9 млрд параметров. Крупную картинку модель режет на фрагменты до 12 штук и добавляет уменьшенную копию целиком, поэтому может разбирать мелкие детали.

Это младшая из двух моделей линейки Aya Vision. Старшая, Aya Vision 32B, вышла в тот же день. Главное отличие линейки — упор на многоязычность: модель обучали на 23 языках, среди них русский, арабский, хинди, японский и персидский. Для этого Cohere переводила и перефразировала обучающие данные и создавала синтетические подписи к картинкам. Потом языковую модель объединяли с дообученной визуальной частью. По замерам лаборатории, в попарных сравнениях на своих тестах AyaVisionBench и mWildBench она выигрывает у Qwen2.5-VL 7B, Gemini Flash 1.5 8B, Llama 3.2 11B Vision и Pixtral 12B в 79% и 81% случаев соответственно.

Модель берут, чтобы описывать изображения, распознавать на них текст, отвечать на вопросы по картинке и разбирать снимки кода. Особенно она полезна там, где нужен не только английский язык. Небольшой размер позволяет запускать её на своём оборудовании. Cohere также открыла доступ к модели через WhatsApp.

Веса выложены под лицензией CC-BY-NC: её разрешено использовать только в некоммерческих целях, и нужно соблюдать правила допустимого использования Cohere Labs. Лаборатория называет модель исследовательской. Отвечает она только текстом: картинки не создаёт. Сравнения с конкурентами проведены на тестах самой Cohere.

Источники: Карточка модели на Hugging Face, Технический разбор Aya Vision от Cohere

Данные: models.dev (MIT).