ИИтак

← Назад

DeepSeek открыла веса V4.1-Flash: на 552 млрд параметров, но с очень лёгкой памятью контекста

DeepSeek выложила на Hugging Face веса мультимодальной модели V4.1-Flash под лицензией MIT. На каждый токен в ней работают 8–16 млрд параметров, а память контекста вчетверо меньше, чем у V4-Flash.

DeepSeek выложила на Hugging Face веса модели V4.1-Flash, которую недавно открыла через API. Их можно скачать и запустить у себя, лицензия MIT разрешает и коммерческое использование. В карточке модели компания подробно описала, как она устроена и почему обходится дешевле предшественниц.

Всего в модели 552 млрд параметров, но на каждый токен работает лишь малая их часть. Когда модель читает входной текст, задействованы 8 млрд параметров, а когда пишет ответ — 16 млрд. Это смесь экспертов: в каждом слое 384 узких «специалиста», и на каждый токен подключаются шесть из них плюс один общий. Модель понимает текст и изображения, держит до миллиона токенов контекста и обучена с нуля на 45 трлн токенов.

Главное, чем DeepSeek хвалится в самом названии отчёта, — сжатие KV-кэша, то есть памяти, в которой модель хранит уже прочитанный контекст. Для этого половина слоёв работает как кодировщик и готовит общую память для всех слоёв декодера, соседние слои делят между собой одни и те же данные, а сами данные хранятся в 4-битном формате. В итоге на один токен уходит 890 байт. По подсчётам авторов, это примерно вчетверо меньше, чем у V4-Flash, и в 437 раз меньше, чем у первой DeepSeek. Для агентов, которые читают огромные объёмы кода и документов, такая экономия сразу превращается в деньги.

Глубину рассуждений можно задавать числом от 1 до 100: чем выше значение, тем точнее ответ и тем дороже запрос. На максимальной настройке модель, по данным DeepSeek, набирает 90,6 в Terminal-Bench 2.1 против 89,1 у Opus 5.0 и 74,2 в DeepSWE против 74,0. Однако на более новых и трудных версиях Terminal-Bench она заметно отстаёт от Opus: 30,0 против 43,3 в третьей и 31,2 против 51,8 в четвёртой. Флагман V4-Pro новинка обходит почти во всех агентных тестах.

Готового шаблона диалога в формате Jinja, которым обычно пользуются популярные программы для запуска моделей, в релизе нет. Вместо него DeepSeek выложила эталонный скрипт на Python и отдельный набор библиотек на Rust. Они переводят запросы в формате распространённых API в запросы для модели и разбирают её ответы. Все результаты тестов — заявления самой компании, и независимых проверок пока нет.

← Все новости