ИИтак

← Назад

Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

Qwen3.8-Omni-Flash принимает текст, картинки, звук и видео, держит контекст до 1 млн токенов и умеет вызывать инструменты. По данным Alibaba, обработка видео стоит примерно на 89% меньше, чем у Qwen3.5-Omni-Plus.

18 сентября команда Qwen из Alibaba представила Qwen3.8-Omni-Flash. Модель одновременно понимает текст, изображения, звук и видео и умеет сама вызывать внешние инструменты. В посте в X её называют первой омнимодальной моделью Qwen, которую с самого начала строили под агентную работу: разобраться в ролике, спланировать задачу, выполнить её с помощью инструментов и сдать готовый результат. В качестве примеров команда приводит автоматический монтаж влогов, перевод коротких видео и пересказы фильмов.

Модель построена на архитектуре Qwen3.8-Flash-Next, контекстное окно у неё до 1 млн токенов. По описанию на странице модели, помимо программирования, интеллектуального труда и управления графическим интерфейсом она заметно лучше прежних версий справляется с задачами, где нужно обрабатывать всё сразу: монтажом видео, созданием музыкальных клипов, озвучкой, сводками по мультимедиа, диалогом голосом и видео. Модель различает направление звука в двух- и четырёхканальных записях и понимает речь на 113 языках и диалектах, как и Qwen3.5-Omni.

Длинные ролики модель не просматривает целиком. Она сама перемещается по записи и ищет ключевые эпизоды. По данным Qwen, на бенчмарке OmniVideoBench такой подход тратит на 51,8% меньше токенов, чем обычный просмотр всего видео, и при этом находит нужные моменты точнее. В агентных задачах прирост в среднем составил 19,5 пункта на бенчмарках WildClawBench-MM и UniClawBench. По работе с аудио и видео авторы называют модель близкой к Gemini 3.8 Flash. Все это собственные замеры Qwen.

Модель доступна через API в облаке Alibaba. Можно подключаться по протоколу DashScope или по протоколу, совместимому с OpenAI. Список регионов включает Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджинию. Модель поддерживает режим рассуждений, вызов функций и веб-поиск, но из встроенных инструментов Responses API пока доступен только поиск. Обработка видео, по словам Qwen, стоит примерно на 89% дешевле, чем у Qwen3.5-Omni-Plus. На странице модели указана цена закэшированного входа — 0,016 доллара за 1 млн токенов.

Есть важное ограничение: Qwen3.8-Omni-Flash отвечает только текстом. Если нужен ответ голосом, документация Alibaba по-прежнему советует брать Qwen3.5-Omni, которая умеет синтезировать речь и клонировать голоса. Старую линейку Qwen-Omni-Turbo больше не обновляют, её пользователям предлагают переходить на новые модели.

Вместе с моделью Qwen открыла код Qwen-MM-Plugins — дополнений, которые дают сторонним агентным фреймворкам доступ к мультимодальным возможностям модели. Вторая библиотека, Qwen-Live Harness, пока обозначена как «скоро». Открытых весов самой Omni-модели в анонсе нет.

← Все новости