Модель · StepFun
Step 3.7 Flash
Недорогая открытая модель StepFun для агентов, программирования и работы с картинками, быстрее и точнее Step 3.5 Flash
вышла 29 мая
Характеристики
- Вышла
- 29 мая
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 256 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 256 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,185 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,037 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,11 за миллион токенов
- Понимает
- текст, изображения, видео
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- март 2026
- Идентификатор в API
- step-3.7-flash
Что это за модель
Step 3.7 Flash — модель китайской компании StepFun, которая понимает и текст, и изображения. Она построена как смесь экспертов (mixture of experts): внутри много специализированных блоков, и на каждый токен включается только часть из них. Всего у неё около 198 млрд параметров: языковая часть на 196 млрд и визуальный кодировщик на 1,8 млрд. На каждый токен работает примерно 11 млрд. Поэтому модель отвечает быстро: по данным компании, до 400 токенов в секунду. Глубину рассуждений можно выбрать из трёх уровней — низкого, среднего и высокого, — чтобы найти баланс между скоростью, ценой и качеством.
По сравнению со Step 3.5 Flash новая версия заметно подросла в программировании и агентных задачах. По замерам StepFun, она набирает 56,3% в SWE-Bench Pro (исправление реальных ошибок в коде) и около 59,6% в Terminal-Bench 2.1 (работа в командной строке). В ClawEval-1.1, который проверяет надёжность агента в многошаговых процессах, результат вырос с 59,8 до 67,1. Компания заявляет, что модель стала ровнее работать в разных средах запуска для агентов. Появился и режим советника (Advisor Mode): в трудных местах модель может обратиться за помощью к более крупной модели и не гонять её на всей задаче.
StepFun позиционирует модель как рабочую лошадку для агентов в реальных задачах. Её берут, чтобы писать и править код, запускать много агентов параллельно, искать в интернете и сверять источники, разбирать объёмные отчёты за один проход, понимать скриншоты и управлять графическим интерфейсом программ. Веса открыты, так что модель можно запустить у себя. Для этого нужна машина примерно со 128 ГБ общей памяти, например Mac Studio, NVIDIA DGX Station или компьютер на AMD Ryzen AI Max+ 395.
Модель выпущена под лицензией Apache 2.0, которая разрешает коммерческое использование. Компания прямо говорит, что не пыталась уместить в веса все знания о мире. Нехватку знаний и слабые места в распознавании изображений модель должна закрывать инструментами: поиском, запуском кода и так далее. StepFun также признаёт, что в работе с терминалом и в структурированных профессиональных задачах модель пока отстаёт от лидеров.
Источники: Анонс Step 3.7 Flash в блоге StepFun, Карточка модели на Hugging Face, Документация StepFun
Данные: models.dev (MIT).