Модель · Cohere
Aya Expanse 8B
Малая открытая модель Cohere для чата и работы с текстом на 23 языках, включая русский, для некоммерческих исследований
вышла 24 октября 2024
Характеристики
- Вышла
- 24 октября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4 тыс. токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- c4ai-aya-expanse-8b
Что это за модель
Aya Expanse 8B — модель на 8 миллиардов параметров от исследовательского подразделения Cohere For AI (теперь Cohere Labs). Это авторегрессионный трансформер, то есть он пишет текст по одному токену подряд. Основой служит предобученная модель из линейки Command. Aya Expanse 8B понимает и пишет на 23 языках: среди них русский, украинский, арабский, хинди, китайский, японский, турецкий и основные европейские. Одновременно с ней вышла старшая Aya Expanse 32B.
Лаборатория описывает модель как итог года исследований и называет три главных приёма. Первый — «арбитраж данных»: учебные примеры берут не у одной модели-учителя, а у нескольких, и для каждого запроса отдельная модель-оценщик выбирает лучший ответ. Так авторы хотели избежать деградации на языках, где данных мало. Второй — обучение на предпочтениях на многих языках: сильные ответы, написанные сразу на нужном языке, сравнивают со слабыми переводными. Третий — слияние моделей: несколько версий, дообученных на разных языковых группах, объединяют в одну взвешенным усреднением. У малой модели этот приём дал меньший прирост, чем у 32B.
По замерам лаборатории на тесте m-ArenaHard (Arena-Hard-Auto, переведённый на 23 языка, ответы оценивает GPT-4o) Aya Expanse 8B выигрывает у Gemma 2 9B, Llama 3.1 8B и Ministral 8B в 60,4–70,6% сравнений. Компания также заявляет, что по сравнению с предшественницей Aya 23 доля побед выросла больше чем на 9,1% уже после первого этапа дообучения. Модель берут для чата, переписки, пересказа и других текстовых задач на разных языках, особенно когда её нужно запустить у себя на обычной видеокарте.
Ограничения видны в карточке модели. Контекстное окно (объём текста, который модель видит сразу) небольшое — около 8 тысяч токенов, поэтому длинные документы ей не подходят. Работает она только с текстом, для картинок у Cohere позже вышла Aya Vision. Веса открыты по лицензии CC-BY-NC: коммерческое применение запрещено, кроме того, нужно соблюдать правила допустимого использования Cohere Labs. Сама лаборатория называет модель исследовательским выпуском.
Источники: Карточка модели на Hugging Face, Технический разбор Aya Expanse
Данные: models.dev (MIT).