Модель · Qwen
Qwen2.5 7B Instruct
Устаревшая открытая модель Qwen на 7 млрд параметров для чатов и простых задач, помещается на одну видеокарту
вышла 1 сентября 2024
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
196 место из 266
индекс 118, вероятный разброс 111–121 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 12,9% | |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 7,6% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 0,0% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 2,4% | |
| BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ | 7,8% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 14,0% | |
| MMLUВопросы с четырьмя вариантами ответа из десятков областей: гуманитарные и естественные науки, социальные науки, профессиональные знанияТест почти насыщен: сильные модели набирают около 90% и выше, и разница между лидерами мала, а часть промахов приходится на ошибки в самом тесте.Подробнее на английском ↗ | 63,9% |
Характеристики
- Вышла
- 1 сентября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 8,2 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,175 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,70 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen2-5-7b-instruct
Что это за модель
Qwen2.5 7B Instruct — модель из линейки Qwen2.5, которую команда Qwen из Alibaba Cloud выпустила осенью 2024 года. В линейку вошли семь размеров, от 0,5 до 72 млрд параметров. Эта модель средняя по размеру: 7,6 млрд параметров. Она дообучена следовать инструкциям, поэтому подходит для диалога. Устроена как обычный плотный трансформер из 28 слоёв. Чтобы при работе нужно было меньше памяти, в ней применён приём, при котором несколько «голов» внимания используют общие данные (grouped query attention).
По сравнению с Qwen2 лаборатория увеличила обучающий корпус до 18 трлн токенов. Компания заявляет, что модели линейки стали больше знать, лучше программировать и решать задачи по математике. Кроме того, они точнее следуют инструкциям и системному запросу, лучше понимают таблицы и надёжнее выдают ответ в формате JSON. Ещё одно улучшение — длинные тексты: модель пишет до 8 тыс. токенов за раз. Заявлена поддержка более 29 языков, среди них русский. С тех пор у Qwen вышли десятки более новых моделей, включая линейки Qwen3.x. В рейтинге Epoch эта модель стоит во второй половине списка.
Модель берут, когда нужна небольшая открытая модель, которую можно запустить на своей видеокарте или дообучить под свою задачу. Подходит для простого чата, пересказа и разбора текста, извлечения данных в структурированном виде и несложных вызовов инструментов. Многие исследователи и энтузиасты используют её как базу для экспериментов.
Веса опубликованы под лицензией Apache 2.0, она разрешает коммерческое использование. По умолчанию модель настроена на тексты до 32 тыс. токенов. Чтобы обрабатывать тексты длиннее, нужно отдельно включить приём растяжения контекста YaRN. В карточке модели предупреждают, что он может ухудшить ответы на короткие тексты. Для сложных рассуждений и программирования она заметно слабее современных моделей Qwen и крупных версий своей же линейки.
Источники: Анонс линейки Qwen2.5, Карточка модели на Hugging Face
Того же уровня по индексу Epoch
-
Mistral Nemo
Mistral194-е место в Epochконтекст 128 тыс.$0,15 / $0,15открытые весадешевле в 4,7 раза
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).