Модель · Qwen
Qwen3.5 397B-A17B
Прежняя флагманская открытая модель Qwen для агентов, программирования и работы с картинками и видео
вышла 15 февраля
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
59 место из 266
индекс 147, вероятный разброс 145–149 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 79,1% | |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 44,6% | |
| Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ | 9,7% | |
| FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ | 31,2% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 8,5% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 88,9% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 81,8% |
Характеристики
- Вышла
- 15 февраля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,60 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $3,60 за миллион токенов
- Понимает
- текст, изображения, видео, аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- qwen3.5-397b-a17b
Что это за модель
Qwen3.5-397B-A17B — первая модель линейки Qwen3.5 с открытыми весами. Она устроена как смесь экспертов: всего в ней 397 млрд параметров, но на каждый токен работают только 17 млрд. Из 512 экспертов, то есть специализированных подсетей, для каждого токена выбираются 11. Обычное внимание в ней чередуется с линейным (Gated DeltaNet): оно дешевле обходится на длинных текстах. Картинки и видео модель понимает сама, без отдельного визуального модуля: текст и изображения смешивали уже на обучении.
По замерам Qwen, качество у неё на уровне закрытой Qwen3-Max, а текст она выдаёт в 8,6 раза быстрее на контексте в 32 тысячи токенов и в 19 раз быстрее на 256 тысячах. Лаборатория заявляет, что в рассуждениях, программировании и задачах со зрением модель обходит прежнюю визуальную Qwen3-VL. Поддержка языков и диалектов выросла со 119 до 201. Среди результатов из карточки модели: 87,8 балла в MMLU-Pro, 88,4 в GPQA, 88,6 в MathVision и 90,3 в MathVista.
Модель берут для агентных задач, где нужно действовать по шагам и вызывать инструменты. Также она подходит для программирования, длинных технических задач и разбора изображений и видео. Агентные навыки лаборатория отрабатывала обучением с подкреплением в большом числе смоделированных сред. Контекст можно растянуть примерно до миллиона токенов с помощью техники YaRN.
По умолчанию модель рассуждает перед ответом, но через параметры API это можно отключить. На сложных задачах рассуждения длинные: для них Qwen советует оставлять место под ответ длиной до 81 920 токенов. Веса выложены по лицензии Apache 2.0, она разрешает коммерческое использование. Но для запуска модели на своём оборудовании нужен серверный кластер. С тех пор у Qwen вышли линейки Qwen3.6, Qwen3.7 и Qwen3.8, так что эта модель уже не самая новая.
Источники: Карточка модели на Hugging Face, Анонс Qwen3.5 в блоге Qwen
Того же уровня по индексу Epoch
-
Claude Sonnet 4.5
Anthropic61-е место в Epochконтекст 1 млн$3 / $15рассуждениядороже в 4,2 раза
-
Qwen3.5 Plus
Qwen62-е место в Epochконтекст 1 млн$0,40 / $2,40рассуждениядешевле в 1,5 раза
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждениядешевле
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).