ИИтак

← Назад

Alibaba выпустила пять аудиомоделей Qwen-Audio-3.1 и снизила цены на 70–95%

Синтез речи подешевел примерно на 70%, режим живого разговора — на 85%, распознавание речи — до 95%. Две модели из пяти новые: они работают не только с речью, но и с фоновыми звуками.

Alibaba обновила три аудиомодели Qwen — для распознавания речи (ASR), синтеза речи (TTS) и живого голосового разговора в реальном времени — и добавила к ним две новые, ASR-Next и TTS-Next, сообщила команда Qwen в соцсети X. По словам команды, вместе пять моделей закрывают всю работу со звуком: понимание, генерацию, разговор и создание аудиоконтента.

Цены снижены по всей линейке, но новых расценок в долларах в анонсе нет. Через API уже доступны обновлённая модель распознавания Qwen-Audio-3.1-ASR и модель для разговора в реальном времени Qwen-Audio-3.1-Realtime. Остальные появятся в облаке Qwen Cloud1 позже, обещает команда.

Подробнее всего описана модель синтеза речи Qwen-Audio-3.1-TTS: ей посвящён технический отчёт. Она говорит на 16 языках, семь из них добавлены в этой версии, и на диалектах 20 регионов Китая. За один проход модель озвучивает до трёх минут текста.

Голосом управляют обычными словами: в инструкции можно описать роль, эмоцию, манеру речи, темп, тембр и акцент. Для точной настройки в текст вставляют одну из 86 новых меток — тогда модель в нужном месте засмеётся, вздохнёт, кашлянет или переведёт дыхание. Для клонирования голоса2 подходит и шумная запись или запись с эхом, отдельный режим шумоподавления не нужен.

Чтобы отвечать быстрее, модель нарезает речь на крупные кадры — по 12,5 в секунду, поэтому для генерации нужно меньше шагов. По данным отчёта, Qwen-Audio-3.1-TTS занимает первое место в независимом рейтинге синтеза речи Artificial Analysis3.

Новая TTS-Next построена на связке языковой и диффузионной модели4. За один проход она создаёт голос, звуковые эффекты и фон — для аудиокниг, подкастов, игр и рекламы.

Обновлённая модель распознавания лучше понимает языки и диалекты и сама убирает из расшифровки слова-паразиты и повторы. Новая ASR-Next различает нескольких собеседников, подписывает их реплики и ставит временные метки. Она также распознаёт эмоции, фоновые и машинные звуки: может описать, что слышно на записи, найти момент события и ответить на вопросы о ней.

Модель для разговора в реальном времени слушает и говорит одновременно, её можно перебить в любой момент, как в обычном звонке. Если модель слышит, что у собеседника плохое настроение, она, по словам команды, замедляет речь и отвечает с сочувствием.

Ранее, 19 сентября, Alibaba показала Qwen3.8-LiveTranslate — модель для синхронного перевода речи, а 18 сентября выпустила Qwen3.8-Omni-Flash, которая принимает текст, картинки, звук и видео.

← Все новости