ИИтак

← Назад

Модель · Qwen

Qwen3-Next 80B-A3B Instruct

Устаревшая открытая модель Qwen для чата и агентов: из 80 млрд параметров на каждый токен работают около 3 млрд

вышла 1 сентября 2025

Характеристики

Вышла
1 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
апрель 2025
Идентификатор в API
qwen3-next-80b-a3b-instruct

Что это за модель

Qwen3-Next 80B-A3B Instruct — первая модель линейки Qwen3-Next, в которой Qwen опробовала новую, более экономную архитектуру. Всего у неё 80 млрд параметров, но устроена она как смесь экспертов (mixture of experts): внутри 512 небольших подсетей-«экспертов», и на каждый токен включаются только 10 из них. Поэтому при генерации работают лишь около 3 млрд параметров. Внимание гибридное: обычные слои внимания чередуются со слоями Gated DeltaNet, которые дешевле обрабатывают длинный текст. Ещё модель умеет предсказывать несколько токенов за шаг, и это ускоряет генерацию.

Это версия Instruct, то есть обычная модель для диалога. Она отвечает сразу, без отдельного блока рассуждений. Для задач, где нужно долго думать, у линейки есть парная версия Thinking. По замерам лаборатории, базовая модель превосходит Qwen3-32B, хотя на её обучение ушло около 10% вычислительных мощностей. На текстах длиннее 32 тысяч токенов она выдаёт в 10 раз больше токенов в секунду. Instruct-версия, по словам Qwen, на многих бенчмарках идёт вровень с намного более крупной Qwen3-235B-A22B-Instruct-2507, а на очень длинных текстах её обгоняет.

Её берут для чата, работы с длинными документами, вызова инструментов и агентных сценариев. Qwen проверяла модель на знаниях (MMLU-Pro, GPQA), программировании (LiveCodeBench), выполнении инструкций (IFEval, Arena-Hard v2), работе агентов (BFCL-v3, TAU) и на многоязычных тестах. Веса открыты по лицензии Apache 2.0: модель можно запускать на своих серверах и использовать в коммерческих продуктах.

У модели есть оговорки. В стандартной библиотеке Transformers не работает ускорение за счёт предсказания нескольких токенов: для него нужны серверные движки вроде vLLM или SGLang. Контекст можно растянуть примерно до миллиона токенов способом YaRN, но лаборатория предупреждает, что на коротких текстах качество от этого может просесть. С тех пор Qwen выпустила много более новых моделей, включая линейки Qwen3.6–Qwen3.8.

Источники: Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).