ИИтак

← Назад

Модель · StepFun

StepAudio 2.5 TTS

Модель StepFun для озвучки текста: эмоции, темп и паузы задаются обычными словами, голос клонируется по трёхсекундной записи

вышла 16 апреля

Характеристики

Вышла
16 апреля
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
stepaudio-2.5-tts

Что это за модель

StepAudio 2.5 TTS — модель синтеза речи от StepFun: она превращает текст в озвучку. Компания называет её контекстной: модель учитывает смысл и настроение текста, поэтому текст звучит как исполнение, а не как ровное чтение. Она входит в линейку StepAudio 2.5 вместе с моделью распознавания речи StepAudio 2.5 ASR и голосовой моделью для живого диалога StepAudio 2.5 Realtime.

По техническому отчёту лаборатории, в модели нет отдельного блока, который кодирует входные данные и передаёт их языковой модели. Всё делает сама большая языковая модель: звук разбит на аудиотокены, то есть на короткие кусочки, и она предсказывает их по одному, как слова в тексте. Сначала модель дообучали клонировать голос и следовать общим указаниям, потом учили более тонкому управлению на собственных данных компании. В конце её доучивали с подкреплением: оценки выставляла отдельная модель, настроенная на предпочтения людей.

Главное отличие от обычного синтеза речи — управление голосом на двух уровнях. Общая инструкция задаёт настроение и темп для всего отрывка, например «голос напряжён, темп быстрый и сбивчивый». Пометки в скобках прямо в тексте уточняют отдельные фразы и вслух не читаются. Особые теги и готовые наборы стилей не нужны: всё описывается обычными словами. Модель также клонирует голос без дообучения по записи длиной в три секунды, и управлять таким голосом можно так же. Её берут для озвучки рассказов, ролей персонажей и дикторского текста.

Лаборатория устроила попарные слепые сравнения, где люди выбирали лучший вариант. Против MiniMax-2.8-HD, ElevenLabs-v3 и Gemini-3.1-Flash-TTS её вариант, по данным StepFun, выиграл в 67,6% сравнений. В отчёте признаётся, что привычные автоматические показатели качества для такой модели искажены, поэтому компания опиралась на оценки людей. За один запрос модель озвучивает до 1000 знаков текста, а общая инструкция ограничена 200 знаками.

Источники: Документация StepAudio 2.5 TTS, Технический отчёт StepAudio 2.5

Другие модели семейства

Данные: models.dev (MIT).