Alibaba открыла веса Qwen3.8-Max на 2,4 трлн параметров, NVIDIA показала её скорость
Qwen3.8-2.4T-A95B — крупнейшая модель Alibaba с открытыми весами: 2,4 трлн параметров и контекст до миллиона токенов. На стойке GB300 NVL72 она уже в день выхода выдаёт больше 350 токенов в секунду на пользователя.

Alibaba выложила в открытый доступ веса Qwen3.8-2.4T-A95B, которую также называют Qwen3.8-Max. Это самая большая модель компании с открытыми весами. Всего в ней 2,4 трлн параметров, но на каждый токен работают только 95 млрд. Модель принимает до миллиона токенов контекста и пишет ответы длиной до 128 тысяч токенов.
Модель рассчитана на агентную работу: программирование, анализ больших массивов документов и долгие задачи из многих шагов. В таких задачах контекст разрастается: копятся инструкции, результаты инструментов, логи и промежуточные рассуждения. Поэтому Alibaba сделала гибридную архитектуру. Слои с полным вниманием, где каждый токен «смотрит» на все остальные, чередуются со слоями линейного внимания. В линейных слоях вместо растущего кэша хранится состояние фиксированного размера. Так расход памяти и вычислений не разгоняется при длинном контексте.
Внутри модель устроена как смесь экспертов. Это множество небольших подсетей, из которых маршрутизатор выбирает нужные для каждого токена. Поэтому стоимость запуска зависит от 95 млрд активных параметров, а не от всех 2,4 трлн. Кроме того, у модели есть три уровня рассуждений: низкий, высокий и очень высокий. Разработчик выбирает уровень для каждого запроса. Высокие подходят для сложных задач из многих шагов, низкий — для быстрой потоковой обработки документов.
NVIDIA проверила модель на стойке GB300 NVL72, где 72 видеокарты Blackwell Ultra объединены в одну систему. Модель запускали без дополнительной настройки, в формате FP8. Она выдала больше 4 000 токенов в секунду на одну видеокарту и больше 350 токенов в секунду на одного пользователя. По словам компании, результат должен улучшиться после оптимизаций, в том числе с переходом на формат NVFP4.
Готовые рецепты запуска есть для SGLang, vLLM и NVIDIA Dynamo. Ещё модель работает в универсальном контейнере NVIDIA NIM. Для дообучения под свою предметную область NVIDIA предлагает библиотеку NeMo AutoModel: она берёт файлы модели прямо с Hugging Face, без конвертации. Скачать веса можно с Hugging Face и ModelScope. Попробовать модель через API можно у DeepInfra, DigitalOcean, Fireworks AI, Modal и OpenRouter.
Запустить такую модель у себя смогут немногие: NVIDIA прямо пишет, что для неё нужны вычислительные мощности масштаба дата-центра. Независимых сравнений качества с закрытыми моделями в материале нет. NVIDIA лишь пишет, что модель близка к передовому уровню.