ИИтак

← Назад

Модель · StepFun

Step 3.5 Flash

Недорогая открытая модель StepFun для агентов и программирования, устаревшая: её сменили Step 3.5 Flash 2603 и Step 3.7 Flash

вышла 29 января

Характеристики

Вышла
29 января
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
256 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 256 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,10 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,02 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,30 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
январь 2025
Идентификатор в API
step-3.5-flash

Что это за модель

Step 3.5 Flash — открытая текстовая модель китайской лаборатории StepFun. На момент выхода компания называла её своей самой сильной открытой моделью. Она устроена как смесь экспертов: всего в ней 196 млрд параметров, но на каждый токен работают только 11 млрд. Поэтому она отвечает быстрее и обходится дешевле, чем плотные модели такого же размера. StepFun выложила не только готовую модель, но и базовые веса, промежуточные веса после дообучения и свой фреймворк для обучения Steptron.

Главный упор сделан на скорость. Модель предсказывает сразу несколько следующих токенов и проверяет их параллельно, а не пишет строго по одному. В трёх слоях из четырёх внимание смотрит только на ближайший отрезок текста, и лишь каждый четвёртый слой видит весь текст целиком. Так длинные документы обрабатываются дешевле. По замерам лаборатории, модель выдаёт 100–300 токенов в секунду, а на задачах программирования в одном потоке — до 350.

Модель рассчитана на агентов, то есть программы, которые сами выполняют многошаговые задачи с инструментами, и на разработку ПО. В анонсе StepFun приводит такие результаты: 74,4% в SWE-bench Verified (исправление реальных ошибок в коде), 51,0% в Terminal-Bench 2.0 (работа в командной строке), 97,3 в математическом AIME 2025 и 88,2 в τ²-Bench (агент ведёт диалог с клиентом). Компания заявляет, что держится на уровне Kimi K2.5 и GLM-4.7, хотя эти модели крупнее в разы. Сжатую версию можно запустить у себя на мощном компьютере вроде Mac Studio на M4 Max или NVIDIA DGX Spark, но видеопамяти понадобится около 120 ГБ.

Ограничения StepFun назвала сама. Чтобы прийти к ответу, модель пишет длиннее, чем Gemini 3.0 Pro. В узких областях и в долгих диалогах она может ходить по кругу в рассуждениях, смешивать языки, путаться в датах и в том, кто она такая. Лучше всего она справляется с кодом и рабочими задачами, а в разговорах на общие темы слабее. Веса распространяются по лицензии Apache 2.0, которая разрешает коммерческое использование. Позже модель сменили обновлённая Step 3.5 Flash 2603 и Step 3.7 Flash.

Источники: Анонс Step 3.5 Flash в блоге StepFun, Карточка модели на Hugging Face

Данные: models.dev (MIT).