Модель · Qwen
Qwen-Audio-3.1
Линейка речевых моделей Qwen: распознавание и синтез речи, создание аудио и голосовой разговор в реальном времени
вышла 23 сентября
Характеристики
- Вышла
- 23 сентября
- Понимает
- аудио, текст
- Отвечает
- аудио, текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- —
- Идентификатор в API
- qwen-audio-3.1
Что это за модель
Qwen-Audio-3.1 — линейка из пяти речевых моделей Alibaba, выпущенных одновременно. Три модели обновляют прежние: распознавание речи, синтез речи и голосовой разговор в реальном времени. Две появились впервые: одна подробнее разбирает аудио, другая собирает готовые звуковые дорожки. Модели доступны по API на облачной платформе Alibaba Cloud Model Studio. Одновременно с выходом компания снизила цены: синтез подешевел примерно на 70%, голосовой разговор — примерно на 85%, распознавание — до 95%.
Модель распознавания стала лучше понимать разные языки и китайские диалекты. Слова-паразиты и повторы она сама убирает из расшифровки. Её потоковый вариант рассчитан на совещания и живые субтитры: ему можно заранее передать специальные термины, он сам расставляет знаки препинания и, по словам разработчиков, справляется с шумом. Новая модель понимания аудио различает собеседников и ставит метки времени. Кроме того, она замечает эмоции, фоновые и механические звуки и может отвечать на вопросы о записи.
Синтез речи работает на нескольких языках и диалектах и сохраняет голос, когда речь переходит на другой язык. Эмоцию, темп и манеру речи задают обычной текстовой инструкцией. Новая модель для создания аудио за один проход выдаёт речь вместе со звуковыми эффектами и фоном. По описанию лаборатории, в ней языковая модель работает в паре с диффузией — способом генерации, при котором звук постепенно проступает из шума. Ей дают текст, метки времени и до трёх образцов голоса. Компания предлагает её для аудиокниг, подкастов, игр и рекламы. Ограничений у неё немало: только китайский и английский, до 3000 знаков текста и до двух минут звука за раз (для подкастов — до четырёх), готовый звук приходит целиком, а не потоком.
Модель для голосового разговора слушает и говорит одновременно, как собеседник по телефону, и её можно перебить в любой момент. Компания заявляет, что если человек расстроен, модель говорит медленнее и отвечает с сочувствием. По документации, она понимает 11 языков, включая русский, и 20 китайских диалектов, умеет вызывать внешние инструменты и говорить клонированным голосом. Ей можно заранее дать запись голоса нужного человека, чтобы она не отвлекалась на чужие голоса и шум. За один разговор модель держит в памяти не больше 50 реплик или пяти минут звука.
Источники: Документация: модель для голосового разговора, Документация: модель для создания аудио, Документация: потоковое распознавание речи
Новости о модели
- 01
Данные: models.dev (MIT).