ИИтак

← Назад

Модель · Qwen

Qwen3.8-LiveTranslate

Модель Alibaba для синхронного перевода живой речи и видео: озвучивает перевод голосом говорящего с отставанием около двух секунд

вышла 19 сентября

Характеристики

Вышла
19 сентября
Понимает
аудио, видео
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
qwen3.8-livetranslate

Что это за модель

Qwen3.8-LiveTranslate — модель Alibaba для синхронного перевода. Она слушает живую речь, при желании смотрит видео и выдаёт перевод текстом и голосом, пока человек ещё говорит. Модель построена на основе линейки Qwen-Omni. Компания заявляет, что вместо привычной цепочки из трёх шагов (распознавание речи, перевод, синтез речи) здесь работает единая «чередующаяся» архитектура (Interleave): она обрабатывает звук, картинку и текст вместе. Картинка помогает понять, что говорят, когда одного звука мало.

Модель понимает 60 языков и озвучивает перевод на 29. По замерам Alibaba, среднее отставание от говорящего сократилось с 2,8 секунды у прошлой версии до 2,3 секунды. Для сравнения: живой синхронист обычно отстаёт на 2–3 секунды. Компания также говорит, что перевод стал точнее, глаже и короче.

У новой версии появилось три возможности. Она различает собеседников в разговоре нескольких людей и сохраняет голос каждого, то есть переводит голосом, похожим на исходный. Она показывает на одной ленте исходный текст и перевод. А ещё учитывает длинный контекст беседы: так легче выбрать верное значение многозначного слова и не путать термины и имена на протяжении встречи. Модель берут для перевода встреч, конференций, трансляций и видеозвонков.

Это узкая модель-переводчик, а не собеседник общего назначения. Работает она только через облако Alibaba по протоколу WebSocket, который держит постоянное соединение для потокового звука. Лимиты доступа на старте жёсткие: 10 запросов в минуту. Нескольким переговорным хватит, а колл-центру — нет.

Источники: Страница модели на QwenCloud

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-LiveTranslate — модель для синхронного перевода речи и видео

    Qwen · X

  2. 02

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  3. 03

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  4. 04

    Z.ai закрутила лицензию GLM-5.3: гигантам с выручкой от 10 млрд долларов нужна её проверка

    Interconnects

  5. 05

    Alibaba открыла веса Qwen3.8-Flash-Next — модели, по которой можно судить о будущем Qwen4

    NVIDIA для разработчиков

  6. 06

    Alibaba открыла веса Qwen3.8-Max на 2,4 трлн параметров, NVIDIA показала её скорость

    NVIDIA для разработчиков

все 6 новостей о Qwen3.8 →

Данные: models.dev (MIT).