Модель · StepFun
StepAudio 2.5 ASR
Модель StepFun для перевода китайской и английской речи в текст, по данным компании в 4 раза быстрее прошлого поколения
вышла 24 апреля
Характеристики
- Вышла
- 24 апреля
- Понимает
- аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- stepaudio-2.5-asr
Что это за модель
StepAudio 2.5 ASR — модель StepFun для распознавания речи: она принимает аудиозапись и выдаёт текст. Она входит в линейку StepAudio 2.5, где распознавание речи, синтез речи и живой голосовой диалог построены на одной общей основе. Устроена модель так: кодировщик превращает звук в компактное числовое описание, небольшой переходный блок передаёт его языковой модели, а та пишет расшифровку. По данным документации, у модели около 4 млрд параметров.
Главное отличие от прошлого поколения — скорость. Обычная модель пишет текст по одному токену (фрагменту слова) за шаг. У этой есть дополнительный блок, который за шаг предлагает сразу пять следующих токенов. Модель оставляет их, только пока они совпадают с тем, что она выдала бы и так, поэтому точность не страдает. Компания заявляет, что декодирование стало в 4 раза быстрее, задержка ниже на 60%, а затраты на работу модели — на 80% меньше. По её замерам, пятиминутная запись расшифровывается примерно за секунду, а часовая — секунд за 19.
Модель рассчитана на китайский, английский и речь, где два языка смешаны в одной фразе. В техническом отчёте лаборатория приводит средние показатели: 2,97% ошибок в символах на китайских наборах и 3,68% ошибок в словах на английских. Компания говорит, что точность держится на новостях, записях встреч и в шумной обстановке. Модель принимает до 30 минут непрерывного звука, превращает числа и даты из словесной формы в цифры и помечает время каждого слова. Поэтому её берут для субтитров, расшифровки встреч и голосовых агентов.
Есть два режима. В обычном запись отправляют целиком, а текст приходит по частям. В потоковом, под отдельным идентификатором stepaudio-2.5-asr-stream, звук передаётся в реальном времени, а сервер сам находит паузы в речи. Других языков, кроме китайского и английского, модель официально не поддерживает. Веса лаборатория не публиковала: доступ есть только через её API.
Источники: Документация StepFun о модели, Технический отчёт StepAudio 2.5, Анонс StepFun в X
Другие модели семейства
Данные: models.dev (MIT).