ИИтак

← Назад

Модель · Qwen

Qwen2.5 72B Instruct

Устаревшая открытая модель Qwen 2024 года для многоязычного чата, работы с текстом и вызова инструментов

вышла 1 сентября 2024

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

155 место из 266
индекс 129, вероятный разброс 124–131 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 38,2%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 15,8%
METR Time HorizonsНасколько долгие для человека задачи по программированию, машинному обучению и кибербезопасности агент решает самостоятельноРезультат — не процент, а время: длительность задачи (по времени работы эксперта), которую модель решает примерно в половине случаев.Подробнее на английском ↗ 35,8%
GeoBenchПо фотографии улицы, как в игре GeoGuessr, модель должна угадать страну и точные координаты местаРезультат — очки, а не проценты: до 5000 за раунд, и чем дальше догадка от настоящего места, тем меньше очков.Подробнее на английском ↗ 62,0%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 16,0%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 8,0%
The Agent CompanyРабочие задачи в модельной IT-компании: программирование, управление проектами, кадры, финансы, переписка с «коллегами»За частично выполненную задачу начисляются частичные баллы — по пройденным контрольным точкам.Подробнее на английском ↗ 5,7%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 16,2%
OSWorldАгент выполняет задачи на настоящем компьютере — в Ubuntu, Windows и macOS, в обычных программах и браузере, иногда в нескольких сразуЛюди в этом тесте справляются примерно с 72% задач, так что результат около этого уровня уже соответствует человеческому.Подробнее на английском ↗ 5,0%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 32,2%
BBH23 самых трудных задания из набора BIG-Bench — логика, счёт, понимание текста, где нужно рассуждать в несколько шаговТест почти насыщен: современные модели набирают близкие высокие баллы.Подробнее на английском ↗ 73,1%
MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ 63,2%
MMLUВопросы с четырьмя вариантами ответа из десятков областей: гуманитарные и естественные науки, социальные науки, профессиональные знанияТест почти насыщен: сильные модели набирают около 90% и выше, и разница между лидерами мала, а часть промахов приходится на ошибки в самом тесте.Подробнее на английском ↗ 80,4%
PIQAБытовая физическая смекалка: из двух способов выполнить житейское действие выбрать тот, что сработаетЛюди отвечают верно примерно в 95% случаев; тест почти насыщен, и сильные модели различаются слабо.Подробнее на английском ↗ 65,2%
Winogrande44 тыс. предложений, где нужно понять, к кому или чему относится местоимение — проверка здравого смысла, а не знанийТест почти насыщен: люди решают около 94%, сильные модели близки к этому, и лидеры различаются слабо.Подробнее на английском ↗ 64,6%
HellaSwagОписание бытовой ситуации и несколько вариантов продолжения — нужно выбрать самое правдоподобное; проверка здравого смыслаТест почти насыщен: люди решают больше 95%, сильные модели близки к этому, и лидеры различаются слабо.Подробнее на английском ↗ 79,7%
ARC AI2Вопросы по естественным наукам с вариантами ответа из школьных экзаменов для младших и средних классовПодробнее на английском ↗ 92,7%
TriviaQAВопросы из викторин на общую эрудицию, составленные любителями викторин: модель должна дать короткий точный ответПодробнее на английском ↗ 71,9%

Характеристики

Вышла
1 сентября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8,2 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,40 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$5,60 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2024
Идентификатор в API
qwen2-5-72b-instruct

Что это за модель

Qwen2.5 72B Instruct — самая крупная модель линейки Qwen2.5 от команды Qwen из Alibaba. Линейка вышла в семи размерах, от 0,5 до 72 млрд параметров. Эта версия дообучена выполнять инструкции, то есть вести диалог и следовать запросам пользователя. Внутри у неё около 72,7 млрд параметров и 80 слоёв. Лаборатория обучала линейку на 18 трлн токенов, это заметно больше, чем у Qwen2.

По сравнению с Qwen2 компания заявляет, что модель знает больше, лучше программирует и решает задачи по математике. Она точнее выполняет инструкции, пишет длинные тексты, разбирает таблицы и надёжнее выдаёт ответы в формате JSON. Ещё её сделали устойчивее к разным системным запросам, то есть к заданным заранее ролям и правилам поведения. В анонсе лаборатория сравнивала 72B с Llama-3.1-70B и Mistral-Large-V2 и называла её равной им.

Её берут для чата и работы с текстом на многих языках: заявлено больше 29 языков, среди них русский. Ещё она годится для извлечения данных в строгом формате и для сценариев, где нужно вызывать внешние инструменты. Раз веса открыты, модель можно запустить у себя, например через vLLM или Transformers, но для 72 млрд параметров нужно серьёзное железо.

Сегодня модель устарела: у лаборатории вышло несколько десятков более новых моделей, включая линейки Qwen3.6–Qwen3.8, а в рейтинге Epoch она стоит в середине списка. Тексты длиннее 32 тыс. токенов модель читает только с включённым растяжением контекста (YaRN), и в некоторых средах запуска это может ухудшить работу с короткими текстами. В отличие от большинства моделей линейки, веса 72B выложены не под Apache 2.0, а под собственной лицензией Qwen.

Источники: Анонс линейки Qwen2.5, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  2. 02

    Hugging Face пересобрала AUTOMATIC1111 на холсте Gradio из 73 узлов

    Hugging Face

  3. 03

    NeoMME: открытый кодировщик на 260 млн параметров ищет по сканам страниц вдвое быстрее аналога

    Hugging Face

все 3 новости о Qwen2.5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).