ИИтак

← Назад

Модель · Qwen

Qwen3-LiveTranslate Flash Realtime

Устаревшая модель Qwen для синхронного перевода речи и видео с озвучкой, её сменили Qwen3.5 и Qwen3.8 LiveTranslate

вышла 22 сентября 2025

Характеристики

Вышла
22 сентября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
53 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 4,1 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$10 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения, аудио, видео
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2024
Идентификатор в API
qwen3-livetranslate-flash-realtime

Что это за модель

Qwen3-LiveTranslate Flash Realtime — это модель для синхронного перевода, а не обычный чат-бот. Она слушает речь в аудио или видео и почти сразу выдаёт перевод текстом и голосом. Модель построена на мультимодальной Qwen3-Omni, то есть на модели, которая понимает звук, изображение и текст. По словам Qwen, её дообучили на миллионах часов аудио и видео. Внутри лёгкая смесь экспертов: так называют схему, в которой на каждый фрагмент работает только часть сети. Отсюда и скорость.

Главное отличие от чисто звуковых переводчиков в том, что модель ещё и смотрит на видео. Компания заявляет, что она учитывает движение губ, жесты, текст на экране и предметы в кадре. Это помогает в шуме и там, где слово можно понять по-разному. Задержка перевода — около трёх секунд. Отдельный приём, предсказание смысловых единиц, решает проблему разного порядка слов в языках. По замерам лаборатории, так сохраняется больше 94% точности обычного перевода, который делают не в реальном времени. Qwen также пишет, что на тестах перевода речи с китайского, английского и других языков модель точнее Gemini-2.5-Flash, GPT-4o-Audio-Preview и Voxtral Small-24B.

Модель выбирают для живого перевода: видеозвонков, трансляций, конференций, роликов. На слух она понимает 18 языков, среди них русский, английский, немецкий, японский и арабский, а также несколько китайских диалектов, например кантонский и сычуаньский. Говорить умеет на 10 языках. Голос, по словам компании, звучит естественно, а интонация повторяет смысл исходной речи.

Это первая версия линейки LiveTranslate. Позже Qwen выпустила Qwen3.5-LiveTranslate и Qwen3.8-LiveTranslate. Они знают больше языков, отвечают быстрее и умеют клонировать голос. Кроме того, модель дороже большинства моделей в каталоге. Поэтому для новых проектов её стоит сравнить с более свежими версиями.

Источники: Анонс Qwen3-LiveTranslate в блоге Alibaba Cloud, Карточка модели на QwenCloud

Другие модели семейства

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Qwen выложила подсказчик к Qwen-Image-2.1: из короткой просьбы делает подробный запрос

    Qwen · HF

  4. 04

    Расплывчатую правку — в точный запрос: Qwen выложила модель-подсказчик к Qwen-Image-2.1

    Qwen · HF

  5. 05

    Qwen-Image-2.1 научили раздавать по сети — инструкция есть, кода в vLLM-Omni пока нет

    Qwen · X

  6. 06

    Alibaba открыла Qwen-Image-2.1: рисует с прозрачным фоном и правит обведённое кружком

    Qwen · X

все 30 новостей о Qwen3 →

Данные: models.dev (MIT).