ИИтак

← Назад

Модель · Qwen

Qwen3-Omni Flash

Устаревшая мультимодальная модель Qwen: понимает текст, картинки, звук и видео и отвечает голосом, доступна только через API

вышла 15 сентября 2025

Характеристики

Вышла
15 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
65 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,43 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,66 за миллион токенов
Понимает
текст, изображения, аудио, видео
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen3-omni-flash

Что это за модель

Qwen3-Omni Flash — закрытая версия линейки Qwen3-Omni, доступная только через API облака Alibaba. Qwen3-Omni задумана как одна модель на все виды данных: она принимает текст, изображения, звук и видео и может отвечать как текстом, так и живой речью. По словам лаборатории, качество на тексте и картинках при этом не падает по сравнению с моделями, которые работают с одним видом данных.

Устройство линейки лаборатория описывает в техническом отчёте. Модель состоит из двух частей: «мыслитель» (Thinker) разбирает входные данные и формирует ответ, а «говорящий» (Talker) превращает его в речь. Обе части построены по схеме смеси экспертов (mixture of experts) — на каждом шаге работает только часть параметров. Открытая сестра этой модели, Qwen3-Omni-30B-A3B, имеет 30 млрд параметров, из которых одновременно задействовано около 3 млрд. По замерам лаборатории, открытая версия показала лучший результат среди открытых моделей на 32 из 36 тестов по звуку и видео. Устройство и размер самой Flash Qwen отдельно не описывает.

Модель берут для голосовых помощников, распознавания и расшифровки речи, разбора видео и аудиозаписей, а также для агентов, которым нужно вызывать инструменты по голосовой команде. Письменный текст она понимает на 119 языках, речь на входе — на 19 языках, а говорить умеет на 10, среди них русский.

Модель уже устарела. После неё Qwen выпустила Qwen3.5-Omni и Qwen3.8-Omni-Flash. Последнюю лаборатория называет своей первой мультимодальной моделью, изначально построенной для работы агентов. Веса самой Flash не публиковались, поэтому запустить её на своём оборудовании нельзя. Для этого есть открытая Qwen3-Omni-30B-A3B под лицензией Apache 2.0, но ей нужно от 79 до 145 ГБ видеопамяти в зависимости от длины видео.

Источники: Репозиторий Qwen3-Omni на GitHub, Технический отчёт Qwen3-Omni, Анонс преемницы Qwen3.8-Omni-Flash

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).