ИИтак

← Назад

Модель · Qwen

Qwen3.5 122B-A10B

Открытая модель среднего уровня из линейки Qwen3.5 для рассуждений, программирования, агентов и разбора картинок и видео

вышла 23 февраля

Характеристики

Вышла
23 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,40 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$3,20 за миллион токенов
Понимает
текст, изображения, видео, аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
qwen3.5-122b-a10b

Что это за модель

Qwen3.5-122B-A10B — самая крупная модель в средней серии линейки Qwen3.5. Вместе с ней Qwen выпустила Qwen3.5-35B-A3B, Qwen3.5-27B и облачную Qwen3.5-Flash. Над всеми ними стоит флагман линейки Qwen3.5-397B-A17B. Модель построена как смесь экспертов (mixture of experts): всего в ней 122 млрд параметров, но на каждый токен работают около 10 млрд. Из 256 экспертов на каждый токен включаются восемь выбранных и один общий, поэтому ответы считаются заметно дешевле, чем у плотной модели такого же размера.

Главное отличие от Qwen3 — устройство внимания. Три четверти слоёв используют Gated DeltaNet — упрощённый механизм, который быстрее обрабатывает длинные тексты, а остальные слои — обычное внимание. Кроме того, текст, картинки и видео модель учили понимать вместе с самого начала обучения. Раньше для этого у Qwen была отдельная линейка Qwen3-VL. По заявлению лаборатории, Qwen3.5 обходит модели Qwen3-VL в рассуждениях, программировании, агентных задачах и понимании изображений. Число поддерживаемых языков выросло до 201.

Модель берут для сложных рассуждений, программирования, агентов и разбора документов, картинок и видео. По замерам Qwen, она набирает 86,7 в MMLU-Pro, 86,6 в GPQA Diamond, 72,0 в SWE-bench Verified и 86,2 в MathVision. Лаборатория заявляет, что 122B-A10B и 27B сокращают разрыв между средними и передовыми моделями, особенно в сложных агентных сценариях.

Веса выложены под лицензией Apache 2.0, но запустить модель у себя непросто: для обычного развёртывания Qwen рекомендует восемь видеокарт. Режим рассуждений включён по умолчанию. Если его выключить, на сложных задачах ответы могут стать хуже. Линейку Qwen3.5 уже сменили Qwen3.6 и более новые версии, но модели такого размера среди них пока нет.

Источники: Карточка модели на Hugging Face, Анонс средней серии Qwen3.5

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  6. 06

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

все 12 новостей о Qwen3.5 →

Данные: models.dev (MIT).