ИИтак

← Назад

Модель · Qwen

Qwen3.8-Flash-Next

Экспериментальная открытая модель Qwen для программирования, офисной работы и агентов, ранний образец архитектуры Qwen4

вышла 26 августа

Характеристики

Вышла
26 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
—
ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
qwen3.8-flash-next

Что это за модель

Qwen3.8-Flash-Next — открытая модель Alibaba, в которой команда Qwen заранее показывает устройство будущей линейки Qwen4. Такую же роль раньше сыграла Qwen3-Next: её гибридная схема потом стала стандартом для Qwen3.5–3.8. Модель построена как смесь экспертов (mixture of experts): у неё 125 млрд параметров, но на каждый токен работают только около 6 млрд. Ещё 51 млрд параметров лежит в отдельных таблицах n-грамм. По нескольким соседним токенам модель находит в них готовые данные и почти не тратит на это вычислений. Эти таблицы можно держать не в памяти видеокарты, а в обычной памяти компьютера.

От прежних моделей Qwen она отличается четырьмя изменениями. Первое — внимание, то есть механизм, которым модель выбирает нужные места в тексте. Слои Gated DeltaNet сжимают историю разговора, а Qwen Sparse Attention с помощью лёгкого индексатора выбирает важные блоки из длинного контекста. Так работа с большими текстами обходится дешевле. Второе — связь между слоями: канал, по которому идут данные, разделён на четыре ветви с управляемыми шлюзами. По словам лаборатории, так информация лучше проходит между слоями, а обучение идёт стабильнее. Третье — те самые таблицы n-грамм, а четвёртое — доработанный оптимизатор Muon. Контекстное окно по документации можно растянуть до миллиона токенов.

Модель рассчитана на программирование, офисную работу и агентные задачи, включая управление смартфоном и компьютером. Она понимает картинки и видео. По умолчанию модель рассуждает перед ответом, но этот режим можно отключить. Qwen заявляет, что обучение обошлось примерно в девять раз дешевле, чем у Qwen3.7-Plus, а в программировании и офисных задачах новая модель сильнее. По замерам лаборатории, в SWE-bench Pro (исправление задач в реальных репозиториях) она набирает 62,5 против 55,8 у Qwen3.7-Plus. В GPQA Diamond у неё 91,7, в офисном CoWorkBench — 73,9, в AndroidWorld (управление смартфоном) — 84,5.

Это предварительная версия новой архитектуры. Для рабочей среды Qwen предлагает Qwen3.8 Flash — облачную модель на её основе, где миллион токенов контекста включён по умолчанию и есть встроенные инструменты. Веса выложены под лицензией Qwen Community License 1.0, она строже, чем Apache 2.0 у Qwen3.8-27B. Модель можно использовать, дообучать и продавать производные от неё. Но компаниям, которые продают доступ к моделям через API или делают коммерческих помощников для программирования и офисной работы, нужна отдельная лицензия от Qwen. На внутреннее использование внутри организации это ограничение не распространяется. Продукты с аудиторией больше 100 млн пользователей в месяц или выручкой больше 20 млн долларов в месяц должны заметно указывать название модели Qwen.

Источники: Карточка модели на Hugging Face, Описание архитектуры на GitHub, Текст лицензии Qwen Community License 1.0

Новости о модели

  1. 01

    Alibaba выпустила модель синхронного перевода речи Qwen3.8-LiveTranslate

    Qwen · X

  2. 02

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  3. 03

    Alibaba открыла веса Qwen3.8-Flash-Next с архитектурой будущей Qwen4

    NVIDIA для разработчиков

  4. 04

    Alibaba выложила открытые веса Qwen3.8-Max — модели на 2,4 трлн параметров

    NVIDIA для разработчиков

все упоминания Qwen3.8 — 12 →

Данные: models.dev (MIT).