ИИтак

← Назад

Модель · Qwen

Qwen3.8 Flash

Недорогая модель Qwen для программирования, агентов и офисных задач, понимает картинки и видео; облачная версия открытой Flash-Next

вышла 26 августа

Характеристики

Вышла
26 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,016 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,47 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
qwen3.8-flash

Что это за модель

Qwen3.8-Flash — облачная модель Alibaba, построенная на открытой Qwen3.8-Flash-Next. Лаборатория называет её официальной версией Flash-Next с доработками для рабочей среды: контекст в 1 млн токенов включён по умолчанию, есть встроенные инструменты. В основе — смесь экспертов (mixture of experts): всего 125 млрд параметров, но на каждый токен работают только 6 млрд. Поэтому модель отвечает быстро и стоит недорого.

Главное отличие от прошлых моделей — новая архитектура, которую Alibaba называет ранним превью Qwen4. В трёх слоях из каждых четырёх работает Gated DeltaNet: этот механизм сжимает прочитанное в состояние фиксированного размера. Оставшийся слой — внимание по всему контексту, чтобы точно находить нужное место в длинном тексте. Лаборатория также добавила собственное разреженное внимание Qwen Sparse Attention, чтобы снизить задержку. По словам компании, модель обходит Qwen3.7-Plus, а обучение обошлось примерно в девять раз дешевле. Сильнее всего результаты выросли в программировании и офисных задачах.

Модель берут для агентных задач, программирования, долгой работы с документами, а также для разбора картинок и видео. По замерам лаборатории, в SWE-bench Pro (исправление реальных ошибок в коде) она набирает 62,5, в GPQA Diamond (научные вопросы) — 91,7. В CoWorkBench (долгие офисные задачи) у неё 73,9, в AndroidWorld (управление смартфоном) — 84,5. Эти цифры приведены для открытой Flash-Next.

По умолчанию модель рассуждает перед ответом. Из-за этого даже на простые вопросы она отвечает медленнее. Открытые веса Flash-Next выходят не под свободной лицензией вроде Apache, а под собственной лицензией Alibaba qwen-community-1.0. У открытой версии встроенный контекст — 262 144 токена, а дальше его растягивают специальным методом масштабирования. В облачной Qwen3.8-Flash миллион токенов доступен сразу.

Источники: Карточка Qwen3.8-Flash-Next на Hugging Face, Анонс Qwen3.8-Flash-Next в блоге Qwen

Другие модели семейства

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-LiveTranslate — модель для синхронного перевода речи и видео

    Qwen · X

  2. 02

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  3. 03

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  4. 04

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  5. 05

    Alibaba открыла веса Qwen3.8-Flash-Next — модели, по которой можно судить о будущем Qwen4

    NVIDIA для разработчиков

  6. 06

    Alibaba открыла веса Qwen3.8-Max на 2,4 трлн параметров, NVIDIA показала её скорость

    NVIDIA для разработчиков

все 6 новостей о Qwen3.8 →

Данные: models.dev (MIT).