DeepSeek V4.1-Flash в независимых тестах: очень многословна, но всё равно дешевле всех
Artificial Analysis и Vals проверили V4.1-Flash. Модель обошла прежний флагман DeepSeek и стала первой среди открытых моделей в рейтинге Vals. Токенов она тратит больше Claude Opus 5, но задача обходится ей в 27 центов.

Новая модель DeepSeek V4.1-Flash прошла независимые проверки. Результат такой: она пишет длиннее почти всех конкурентов, но задачу всё равно решает в разы дешевле. В индексе Artificial Analysis модель набрала 40 баллов. Это выше прежнего флагмана V4 Pro и чуть ниже GLM-5.3-Flash. В рейтинге Vals она заняла первое место среди моделей с открытыми весами и обошла Kimi K3. Прогон одного теста в Vals стоит 30 центов.
Отдельные тесты выглядят ещё сильнее. В AutomationBench-AA, который проверяет автоматизацию рабочих задач, V4.1-Flash набрала 69% — столько же, сколько GPT-6 Astra. В GDPval-AA она обогнала Kimi K3. Но есть оговорка. На одну задачу из индекса модель тратит в среднем 89 тысяч токенов, больше, чем Claude Opus 5 (73 тысячи). Выручают низкие цены: 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных. Поэтому задача обходится примерно в 0,27 доллара, тогда как у GLM-5.3 и Kimi K3 — около двух долларов.
Размер модели оказался предметом спора. DeepSeek называет 552 млрд параметров. Один пользователь Reddit изучил файлы весов на Hugging Face и насчитал около 748 млрд, если учесть отдельную таблицу-«энграм». Вместе с модулем зрения и вспомогательным блоком выходит 763 млрд. При этом активна лишь малая часть сети: 8 млрд параметров при чтении запроса и 16 млрд при генерации ответа. Кэш модели занимает около 890 байт на токен.
Благодаря такой архитектуре модель на удивление легко запустить на своём оборудовании. Разработчик Фрейзер Прайс вынес таблицу весом около 200 ГБ на NVMe-диск. На четырёх видеокартах RTX Pro модель выдала больше 300 токенов в секунду, а оперативной памяти понадобилось меньше 32 ГБ. Программист Сальваторе Санфилиппо, автор Redis, запустил её на MacBook с чипом M5 Max и 128 ГБ памяти, подгружая данные с SSD.
Себастьян Рашка назвал обновление капитальной переделкой: по его словам, модель «надо было назвать DeepSeek V5». Скептики тоже нашлись. Автор аккаунта TeortaxesTex счёл часть результатов «очень странными» и напомнил о слабом месте лаборатории. По его словам, DeepSeek «выпускает внутренние исследовательские артефакты, а не продукты»: модели хорошо выглядят на собственных тестах, но в реальной работе бывают хрупкими.