ИИтак

← Назад

Модель · Qwen

Qwen3.6 Max Preview

Предварительная версия флагмана Qwen для программирования и агентов, её уже сменили Qwen3.7 Max и Qwen3.8 Max

вышла 20 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

50 место из 266
индекс 149, вероятный разброс 148–152 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 78,7%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 50,0%
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 10,8%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 15,8%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 52,0%
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 6,9%
FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ 40,5%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 91,1%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 55,6%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 76,7%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 83,2%

Характеристики

Вышла
20 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,30 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,13 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$7,80 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2025
Идентификатор в API
qwen3.6-max-preview

Что это за модель

Qwen3.6 Max Preview — ранняя предварительная версия флагманской модели лаборатории Qwen из Alibaba. Её выпустили вскоре после Qwen3.6 Plus, чтобы показать следующую закрытую модель линейки до окончательного выпуска. Архитектуру и размер лаборатория не называла. Модель закрытая: открытых весов нет, работать с ней можно через API в Alibaba Cloud Model Studio и в чате Qwen Studio.

Главное отличие от Qwen3.6 Plus — программирование в агентном режиме, когда модель сама выполняет многошаговые задачи с инструментами. По замерам лаборатории, прирост такой: SkillsBench +9,9 балла, SciCode +6,3, NL2Repo +5,0, Terminal-Bench 2.0 +3,8. Кроме того, выросли знания о мире (SuperGPQA +2,3, китайский тест QwenChineseBench +5,3) и точность следования инструкциям при вызове инструментов (ToolcallFormatIFBench +2,8). Компания заявляет, что на шести тестах по программированию модель заняла первое место, среди них SWE-bench Pro и Terminal-Bench 2.0.

Модель берут для написания кода, работы в терминале и долгих агентных задач. Для таких сценариев в API есть параметр preserve_thinking: он сохраняет рассуждения модели со всех прошлых шагов диалога, и лаборатория советует включать его для агентов. API совместим с форматами OpenAI и Anthropic, поэтому модель можно подключить к уже готовым инструментам без переделки кода.

Лаборатория прямо называет модель предварительной версией, которую ещё дорабатывают, и обещает прирост в следующих версиях. Их уже выпустили: позже вышли Qwen3.7 Max и Qwen3.8 Max, так что для новых проектов разумнее смотреть на них.

Источники: Анонс Qwen3.6-Max-Preview в блоге Qwen, Анонс в блоге Alibaba Cloud

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    NVIDIA выпустила Nemotron 3.5 Lightning — малую открытую модель для рутинной работы агентов

    NVIDIA для разработчиков

все 1 новость о Qwen3.6 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).