Модель · Qwen
Qwen3-LiveTranslate Flash Realtime
Устаревшая модель Qwen для синхронного перевода речи и видео с озвучкой, её сменили Qwen3.5 и Qwen3.8 LiveTranslate
вышла 22 сентября 2025
Характеристики
- Вышла
- 22 сентября 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 53 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 4,1 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $10 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $10 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- апрель 2024
- Идентификатор в API
- qwen3-livetranslate-flash-realtime
Что это за модель
Qwen3-LiveTranslate Flash Realtime — это модель для синхронного перевода, а не обычный чат-бот. Она слушает речь в аудио или видео и почти сразу выдаёт перевод текстом и голосом. Модель построена на мультимодальной Qwen3-Omni, то есть на модели, которая понимает звук, изображение и текст. По словам Qwen, её дообучили на миллионах часов аудио и видео. Внутри лёгкая смесь экспертов: так называют схему, в которой на каждый фрагмент работает только часть сети. Отсюда и скорость.
Главное отличие от чисто звуковых переводчиков в том, что модель ещё и смотрит на видео. Компания заявляет, что она учитывает движение губ, жесты, текст на экране и предметы в кадре. Это помогает в шуме и там, где слово можно понять по-разному. Задержка перевода — около трёх секунд. Отдельный приём, предсказание смысловых единиц, решает проблему разного порядка слов в языках. По замерам лаборатории, так сохраняется больше 94% точности обычного перевода, который делают не в реальном времени. Qwen также пишет, что на тестах перевода речи с китайского, английского и других языков модель точнее Gemini-2.5-Flash, GPT-4o-Audio-Preview и Voxtral Small-24B.
Модель выбирают для живого перевода: видеозвонков, трансляций, конференций, роликов. На слух она понимает 18 языков, среди них русский, английский, немецкий, японский и арабский, а также несколько китайских диалектов, например кантонский и сычуаньский. Говорить умеет на 10 языках. Голос, по словам компании, звучит естественно, а интонация повторяет смысл исходной речи.
Это первая версия линейки LiveTranslate. Позже Qwen выпустила Qwen3.5-LiveTranslate и Qwen3.8-LiveTranslate. Они знают больше языков, отвечают быстрее и умеют клонировать голос. Кроме того, модель дороже большинства моделей в каталоге. Поэтому для новых проектов её стоит сравнить с более свежими версиями.
Источники: Анонс Qwen3-LiveTranslate в блоге Alibaba Cloud, Карточка модели на QwenCloud
Другие модели семейства
-
Qwen3.8 Flash
Qwenконтекст 1 млн$0,15 / $0,47рассуждения
-
Qwen3.8 Max
Qwen14-е место в Epochконтекст 1 млн$2 / $6рассуждения
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Qwen3.7 Max
Qwen33-е место в Epochконтекст 1 млн$2,50 / $7,50рассуждения
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждения
-
Qwen3.6 Max Preview
Qwen50-е место в Epochконтекст 262 тыс.$1,30 / $7,80рассуждения
-
Qwen3.6 35B-A3B
Qwen86-е место в Epochконтекст 262 тыс.$0,248 / $1,485открытые весарассуждения
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).