ИИтак

← Назад

Модель · StepFun

Step TTS 2

Устаревшая модель StepFun для синтеза речи с эмоциями и клонированием голоса, её сменила StepAudio 2.5 TTS

вышла 1 марта

Характеристики

Вышла
1 марта
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
step-tts-2

Что это за модель

Step TTS 2 — модель синтеза речи китайской лаборатории StepFun. Она превращает текст в озвучку и доступна через API компании. StepFun описывает её коротко: чистый звук, насыщенные эмоции и голос, похожий на живого человека. Модель говорит по-китайски, по-английски и по-японски, а также справляется с текстом, где китайский и английский перемешаны.

Главное, на чём делает упор лаборатория, — клонирование голоса, то есть создание собственного голоса по образцу записи. StepFun называет качество клонирования в этой модели лучшим в отрасли. Это её собственная оценка. Клонированному голосу доступны все эмоции и стили модели без доплаты.

Звучание можно настраивать. Эмоции задаются явно: радость, грусть, гнев, страх. Есть и манеры подачи, например мягкая, серьёзная, высокомерная или «старческая». Скорость речи регулируется от половины до двукратной, громкость тоже меняется. Такие настройки нужны для озвучки роликов, аудиокниг, голосовых помощников и службы поддержки.

Среди моделей StepFun Step TTS 2 уже не новинка. В апреле 2026 года лаборатория выпустила StepAudio 2.5 TTS. По словам StepFun, новая модель учитывает смысл всего текста, а подачу в ней можно описать обычными словами. В англоязычной документации сейчас описана уже она, а Step TTS 2 там не упоминается. Языков у Step TTS 2 всего три, так что для других языков она не подходит.

Источники: Документация StepFun по синтезу речи, Документация StepAudio 2.5 TTS

Другие модели семейства

Новости о модели

  1. 01

    ИИ-фабрика NVIDIA 200 раз снизила потребление по сигналу энергосети и не прервала ни одной задачи

    NVIDIA

  2. 02

    Авторы отчёта связали майскую атаку на RubyGems с агентами OpenAI, компания пока не согласна

    Саймон Уиллисон

  3. 03

    NVIDIA научила открытую модель синтеза речи Magpie TTS арабскому, корейскому и португальскому

    Hugging Face

все 3 новости о TTS 2 →

Данные: models.dev (MIT).