ИИтак

← Назад

Модель · Qwen

Qwen3.8-Omni-Flash

Недорогая мультимодальная модель Alibaba: понимает видео и звук, сама вызывает инструменты для монтажа, конспектов и расшифровки встреч

вышла 18 сентября

Характеристики

Вышла
18 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Понимает
текст, изображения, аудио, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
qwen3.8-omni-flash

Что это за модель

Qwen3.8-Omni-Flash — мультимодальная модель Alibaba: в одном запросе она разбирает текст, картинки, звук и видео. Отвечает она только текстом. Модель построена на той же архитектуре, что и Qwen3.8-Flash-Next. Qwen называет её первой своей всеядной моделью, которую с самого начала строили вокруг агентных возможностей. Это значит, что она не просто пересказывает ролик или запись, а планирует задачу, вызывает инструменты и доводит работу до результата. Глубину рассуждений можно настраивать. Кроме обычной версии для готовых файлов есть вариант Realtime для живых потоков.

По замерам Qwen, в среднем по 29 тестам модель на 25% с лишним лучше предшественницы Qwen3.5-Omni-Plus. В агентном тесте WildClawBench-MM она прибавила 36,5 балла и набрала 71,0. Сильнее всего выросла работа со звуком. Модель различает, кто из собеседников говорит, и на тесте AliMeeting ошибается в 3,4% случаев. Лаборатория утверждает, что со звуком модель справляется лучше Gemini 3.8 Flash, а по видео со звуком держится почти на её уровне. При этом обработка звука, по данным Qwen, подешевела более чем на 98%.

Её берут для процессов вокруг аудио и видео: монтаж роликов, клипы под музыку, комментарии к фильмам, конспекты записей, расшифровка встреч с указанием, кто что сказал, локализация видео, голосовые помощники. Модель понимает объёмный звук с двумя и четырьмя каналами и распознаёт речь на 74 языках и 39 диалектах китайского.

Ограничения тоже есть. С чистым текстом и кодом немного лучше справляется Qwen3.8-Flash-Next. На части тестов, где нужно рассуждать по видео, например Video-MME-v2, впереди Gemini 3.8 Flash. Веса модели закрыты: работать с ней можно только через облако Alibaba, в QwenCloud, Model Studio и Qwen Studio.

Источники: Анонс в блоге Qwen, Страница модели в QwenCloud

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-LiveTranslate — модель для синхронного перевода речи и видео

    Qwen · X

  2. 02

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  3. 03

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  4. 04

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  5. 05

    Alibaba открыла веса Qwen3.8-Flash-Next — модели, по которой можно судить о будущем Qwen4

    NVIDIA для разработчиков

  6. 06

    Alibaba открыла веса Qwen3.8-Max на 2,4 трлн параметров, NVIDIA показала её скорость

    NVIDIA для разработчиков

все 6 новостей о Qwen3.8 →

Данные: models.dev (MIT).