Модель · Qwen
Qwen3-Next 80B-A3B Instruct
Устаревшая открытая модель Qwen для чата и агентов: из 80 млрд параметров на каждый токен работают около 3 млрд
вышла 1 сентября 2025
Характеристики
- Вышла
- 1 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $2 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- апрель 2025
- Идентификатор в API
- qwen3-next-80b-a3b-instruct
Что это за модель
Qwen3-Next 80B-A3B Instruct — первая модель линейки Qwen3-Next, в которой Qwen опробовала новую, более экономную архитектуру. Всего у неё 80 млрд параметров, но устроена она как смесь экспертов (mixture of experts): внутри 512 небольших подсетей-«экспертов», и на каждый токен включаются только 10 из них. Поэтому при генерации работают лишь около 3 млрд параметров. Внимание гибридное: обычные слои внимания чередуются со слоями Gated DeltaNet, которые дешевле обрабатывают длинный текст. Ещё модель умеет предсказывать несколько токенов за шаг, и это ускоряет генерацию.
Это версия Instruct, то есть обычная модель для диалога. Она отвечает сразу, без отдельного блока рассуждений. Для задач, где нужно долго думать, у линейки есть парная версия Thinking. По замерам лаборатории, базовая модель превосходит Qwen3-32B, хотя на её обучение ушло около 10% вычислительных мощностей. На текстах длиннее 32 тысяч токенов она выдаёт в 10 раз больше токенов в секунду. Instruct-версия, по словам Qwen, на многих бенчмарках идёт вровень с намного более крупной Qwen3-235B-A22B-Instruct-2507, а на очень длинных текстах её обгоняет.
Её берут для чата, работы с длинными документами, вызова инструментов и агентных сценариев. Qwen проверяла модель на знаниях (MMLU-Pro, GPQA), программировании (LiveCodeBench), выполнении инструкций (IFEval, Arena-Hard v2), работе агентов (BFCL-v3, TAU) и на многоязычных тестах. Веса открыты по лицензии Apache 2.0: модель можно запускать на своих серверах и использовать в коммерческих продуктах.
У модели есть оговорки. В стандартной библиотеке Transformers не работает ускорение за счёт предсказания нескольких токенов: для него нужны серверные движки вроде vLLM или SGLang. Контекст можно растянуть примерно до миллиона токенов способом YaRN, но лаборатория предупреждает, что на коротких текстах качество от этого может просесть. С тех пор Qwen выпустила много более новых моделей, включая линейки Qwen3.6–Qwen3.8.
Источники: Карточка модели на Hugging Face
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).