ИИтак

← Назад

Alibaba открыла веса Qwen3.8-Flash-Next — модели, по которой можно судить о будущем Qwen4

Alibaba выложила веса Qwen3.8-Flash-Next: 125 млрд параметров, из них на каждый токен работают 6 млрд, контекст — до 1 млн токенов. На стойке GB300 NVL72 модель выдаёт больше 200 токенов в секунду на пользователя.

Изображение: NVIDIA для разработчиков

Alibaba выложила открытые веса Qwen3.8-Flash-Next. Компания называет эту модель предварительной версией архитектуры будущего Qwen4: разработчики могут опробовать её заранее. Модель мультимодальная и построена как смесь экспертов. Основная часть содержит 125 млрд параметров, к ним добавлены ещё 51 млрд в N-граммных векторных представлениях. На каждый токен при этом работают только 6 млрд.

Модель рассчитана на задачи с длинным контекстом: агентное программирование, обработку документов и цепочки вызовов инструментов. Её собственное окно — 262 144 токена, а с методом YaRN его можно растянуть до миллиона. Обычно на таких длинах всё упирается в вычисления внимания и память под кэш. Qwen решает это смешанной схемой. Три слоя из четырёх построены на Gated DeltaNet: они постоянно сжимают прочитанное в состояние фиксированного размера, так что память с ростом текста не растёт. Четвёртый слой использует разреженное внимание Qwen Sparse Attention и точно находит нужное во всём контексте.

Отличие Qwen Sparse Attention от прежних подходов в том, что оно оценивает важность не отдельных токенов, а небольших блоков, и читает только самые важные из них. По тестам Alibaba, на миллионе токенов такое внимание обрабатывает запрос до 7,6 раза быстрее полного внимания, а генерирует ответ — до 4,9 раза быстрее. В тесте на миллионе токенов, где 90% начала запроса уже лежит в кэше, модель обработала запрос в 8,6 раза быстрее, чем Qwen3.7-Plus.

NVIDIA проверила модель на стойке GB300 NVL72, где 72 видеокарты Blackwell Ultra связаны в одну систему. Там модель выдаёт больше 16 тысяч токенов в секунду на видеокарту и больше 200 токенов в секунду на каждого пользователя. Опробовать модель можно и на локальном оборудовании: DGX Station, кластерах DGX Spark или рабочей станции с четырьмя RTX PRO 6000 Blackwell.

Веса лежат на Hugging Face и ModelScope, есть и облачная версия в QwenCloud. Для запуска подходят SGLang, vLLM, TensorRT LLM и TokenSpeed. Дообучить модель можно с помощью NeMo AutoModel, а для обучения с подкреплением есть готовые рецепты NeMo RL. Когда выйдет сам Qwen4, ни Alibaba, ни NVIDIA не сообщают.

← Все новости