ИИтак

← Назад

Модель · Qwen

Qwen2.5 7B Instruct

Устаревшая открытая модель Qwen на 7 млрд параметров для чатов и простых задач, помещается на одну видеокарту

вышла 1 сентября 2024

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

196 место из 266
индекс 118, вероятный разброс 111–121 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 12,9%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 7,6%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 0,0%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 2,4%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 7,8%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 14,0%
MMLUВопросы с четырьмя вариантами ответа из десятков областей: гуманитарные и естественные науки, социальные науки, профессиональные знанияТест почти насыщен: сильные модели набирают около 90% и выше, и разница между лидерами мала, а часть промахов приходится на ошибки в самом тесте.Подробнее на английском ↗ 63,9%

Характеристики

Вышла
1 сентября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8,2 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,175 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,70 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2024
Идентификатор в API
qwen2-5-7b-instruct

Что это за модель

Qwen2.5 7B Instruct — модель из линейки Qwen2.5, которую команда Qwen из Alibaba Cloud выпустила осенью 2024 года. В линейку вошли семь размеров, от 0,5 до 72 млрд параметров. Эта модель средняя по размеру: 7,6 млрд параметров. Она дообучена следовать инструкциям, поэтому подходит для диалога. Устроена как обычный плотный трансформер из 28 слоёв. Чтобы при работе нужно было меньше памяти, в ней применён приём, при котором несколько «голов» внимания используют общие данные (grouped query attention).

По сравнению с Qwen2 лаборатория увеличила обучающий корпус до 18 трлн токенов. Компания заявляет, что модели линейки стали больше знать, лучше программировать и решать задачи по математике. Кроме того, они точнее следуют инструкциям и системному запросу, лучше понимают таблицы и надёжнее выдают ответ в формате JSON. Ещё одно улучшение — длинные тексты: модель пишет до 8 тыс. токенов за раз. Заявлена поддержка более 29 языков, среди них русский. С тех пор у Qwen вышли десятки более новых моделей, включая линейки Qwen3.x. В рейтинге Epoch эта модель стоит во второй половине списка.

Модель берут, когда нужна небольшая открытая модель, которую можно запустить на своей видеокарте или дообучить под свою задачу. Подходит для простого чата, пересказа и разбора текста, извлечения данных в структурированном виде и несложных вызовов инструментов. Многие исследователи и энтузиасты используют её как базу для экспериментов.

Веса опубликованы под лицензией Apache 2.0, она разрешает коммерческое использование. По умолчанию модель настроена на тексты до 32 тыс. токенов. Чтобы обрабатывать тексты длиннее, нужно отдельно включить приём растяжения контекста YaRN. В карточке модели предупреждают, что он может ухудшить ответы на короткие тексты. Для сложных рассуждений и программирования она заметно слабее современных моделей Qwen и крупных версий своей же линейки.

Источники: Анонс линейки Qwen2.5, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  2. 02

    Hugging Face пересобрала AUTOMATIC1111 на холсте Gradio из 73 узлов

    Hugging Face

  3. 03

    NeoMME: открытый кодировщик на 260 млн параметров ищет по сканам страниц вдвое быстрее аналога

    Hugging Face

все 3 новости о Qwen2.5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).