Модель · NVIDIA
Magpie TTS Multilingual
Открытая модель NVIDIA для синтеза речи на 12 языках, рассчитана на голосовых агентов с быстрым откликом
вышла 10 августа
Характеристики
- Вышла
- 10 августа
- Понимает
- текст
- Отвечает
- аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- magpie-tts-multilingual
Что это за модель
Magpie TTS Multilingual — модель NVIDIA для синтеза речи: она превращает текст в озвученную речь. Её размер — 364 млн параметров. Устроена она как трансформер с кодировщиком и декодером. Звук модель собирает из дискретных токенов аудиокодека NanoCodec, и за один шаг декодер выдаёт сразу два кадра звука. Так число шагов генерации сокращается вдвое. Чтобы качество при этом не падало, связи между токенами внутри кадра учитывает отдельный малый «локальный» трансформер.
По сравнению с прошлой версией линейка Magpie получила три новых языка: современный литературный арабский, корейский и бразильский португальский. Всего теперь 12 языков, среди них английский, испанский, немецкий, французский, китайский, хинди и японский. Для каждого языка есть мужской и женский голос. По замерам NVIDIA, во французском и испанском модель стала ошибаться реже: доля ошибок в символах (CER) упала с 2,70% до 1,54% и с 1,14% до 0,60%. Голоса в этих языках, по тем же замерам, стали больше похожи на исходных дикторов. Для хинди и японского расширено смешение языков в одной фразе: для этого текст переводится в фонетическую запись.
Главный сценарий — голосовые агенты, где распознавание речи, языковая модель и синтез работают цепочкой. Здесь важно, как быстро прозвучит первый звук ответа. По замерам компании, на ускорителе B200 первый звук появляется через 32 мс, на H100 — через 47 мс. Модель запускают на собственных серверах через контейнеры NVIDIA NIM, поэтому задержки на обращение к чужому облаку нет. Её также применяют для озвучки аудиокниг, дубляжа и инструментов для людей с ограниченными возможностями. Произношение и голоса можно дообучить под свою область во фреймворке NeMo.
Веса выложены под лицензией NVIDIA Open Model License, коммерческое использование разрешено. Клонировать голос по короткому образцу модель не умеет: по словам NVIDIA, эту возможность убрали ради безопасности. Готовых голосов немного, и свой голос можно получить только дообучением. За один раз модель озвучивает до 20 секунд речи. Длинные тексты она обрабатывает в режиме скользящего окна, и лучше всего он работает, когда в тексте есть пунктуация и заглавные буквы. Для других языков, кроме 12 заявленных, модель не предназначена.
Источники: Анонс NVIDIA в блоге Hugging Face, Карточка модели на Hugging Face
Новости о модели
- 01
Данные: models.dev (MIT).