NVIDIA научила открытую модель синтеза речи Magpie TTS арабскому, корейскому и португальскому
Модель Magpie TTS Multilingual на 364 млн параметров теперь говорит на 12 языках. На B200 первый звук она выдаёт через 32 мс, а запускать её можно на своих серверах.

NVIDIA обновила Magpie TTS Multilingual — открытую модель, которая превращает текст в речь. Она выучила ещё три языка: современный литературный арабский, корейский и бразильский португальский. Всего языков теперь 12, среди них английский, испанский, французский, немецкий, мандаринский, хинди и японский. Для каждого языка есть мужской и женский голос.
Модель небольшая, в ней 364 млн параметров. Её сделали для голосовых агентов, которые собирают по частям: распознавание речи, языковая модель и синтез голоса работают отдельными блоками. NVIDIA признаёт, что единая речевая модель проще в подключении: один запрос, на входе звук, на выходе звук. Зато раздельную схему можно поставить на свои серверы, дообучить под свою отрасль и точно увидеть, какое звено тормозит.
Главный довод компании — скорость. На видеокарте B200 первый звук появляется через 32 мс после начала генерации, на других GPU NVIDIA — через 32–79 мс, если поток один. При 64 параллельных потоках B200 выдаёт первый звук через 239 мс и генерирует аудио в 320 раз быстрее, чем оно звучит. Правда, эти цифры получены на оптимизированном контейнере NIM, а не на открытых весах с Hugging Face. Это та же модель, но веса NVIDIA предлагает брать для исследований и дообучения.
Ускорение дают два приёма. Декодер за один шаг предсказывает сразу два кадра звука вместо одного, поэтому шагов вдвое меньше. От этого страдает качество, и его возвращает отдельный малый трансформер, который доводит сгенерированный звук.
Для старых языков качество тоже выросло: ошибок в произношении стало меньше, а голос больше похож на образец. Сильнее всего это заметно на французском и испанском. Хинди и японский лучше справляются с речью, где языки перемешаны. Правила произношения имён и терминов можно задать через собственные словари.
Веса выложены под лицензией NVIDIA Open Model License. Magpie входит в пример голосового агента Nemotron Voice Agent — готовую сборку, где синтез речи работает вместе с распознаванием речи и языковыми моделями Nemotron. Такой агент позволяет себя перебивать и отвечает быстрее чем за секунду.