Модель · Cohere
Aya Vision 8B
Малая открытая модель Cohere для вопросов по картинкам и распознавания текста на 23 языках, младшая в линейке Aya Vision
вышла 4 марта 2025
Характеристики
- Вышла
- 4 марта 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 16 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4 тыс. токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- c4ai-aya-vision-8b
Что это за модель
Aya Vision 8B — открытая модель исследовательского подразделения Cohere Labs. Она отвечает текстом на вопросы о картинках. Модель собрана из трёх частей: языковой модели на основе Command R7B, кодировщика изображений SigLIP2 и адаптера, который их связывает. Всего в ней около 9 млрд параметров. Крупную картинку модель режет на фрагменты до 12 штук и добавляет уменьшенную копию целиком, поэтому может разбирать мелкие детали.
Это младшая из двух моделей линейки Aya Vision. Старшая, Aya Vision 32B, вышла в тот же день. Главное отличие линейки — упор на многоязычность: модель обучали на 23 языках, среди них русский, арабский, хинди, японский и персидский. Для этого Cohere переводила и перефразировала обучающие данные и создавала синтетические подписи к картинкам. Потом языковую модель объединяли с дообученной визуальной частью. По замерам лаборатории, в попарных сравнениях на своих тестах AyaVisionBench и mWildBench она выигрывает у Qwen2.5-VL 7B, Gemini Flash 1.5 8B, Llama 3.2 11B Vision и Pixtral 12B в 79% и 81% случаев соответственно.
Модель берут, чтобы описывать изображения, распознавать на них текст, отвечать на вопросы по картинке и разбирать снимки кода. Особенно она полезна там, где нужен не только английский язык. Небольшой размер позволяет запускать её на своём оборудовании. Cohere также открыла доступ к модели через WhatsApp.
Веса выложены под лицензией CC-BY-NC: её разрешено использовать только в некоммерческих целях, и нужно соблюдать правила допустимого использования Cohere Labs. Лаборатория называет модель исследовательской. Отвечает она только текстом: картинки не создаёт. Сравнения с конкурентами проведены на тестах самой Cohere.
Источники: Карточка модели на Hugging Face, Технический разбор Aya Vision от Cohere
Данные: models.dev (MIT).