ИИтак

← Назад

DeepSeek научила V4 Flash видеть: вышла экспериментальная модель с открытыми весами

DeepSeek выложила на Hugging Face DeepSeek-V4-Flash-Vision-Exp — первую мультимодальную модель семейства V4. Она понимает изображения, в агентных задачах держится около Opus 4.8 и распространяется по лицензии MIT.

Модель DeepSeek V4 Flash научилась работать с изображениями. DeepSeek выложила на Hugging Face DeepSeek-V4-Flash-Vision-Exp — первую мультимодальную модель в семействе V4. Приставка Exp означает, что компания сама называет её экспериментальной. Веса открыты, лицензия MIT разрешает и коммерческое использование.

За основу взята текстовая DeepSeek-V4-Flash. К ней добавили модули для обработки изображений и продолжили обучение. Архитектура осталась прежней: смесь экспертов, собственный механизм внимания DFlash и встроенный ускоритель генерации DSpark. Число параметров в карточке модели не указано.

По данным DeepSeek, в агентных задачах с картинками новая модель заметно сильнее июльской V4-Flash-0731. На ApexBench она набирает 36,5 балла против 26,2, но оговорка важна: старая модель просто не видела изображений из задания. На текстовых задачах результаты остались примерно прежними. На Terminal-Bench 2.1 у новой модели 83,9, у старой — 82,7, а на Cybergym она даже немного уступила.

Для сравнения компания приводит Claude Opus 4.8. На мультимодальных тестах Agents' Last Exam и ZeroBench DeepSeek обходит её на пару баллов, на ApexBench и Chartography немного отстаёт. В ряде текстовых задач разрыв больше: на NL2Repo, где модель должна собрать целый репозиторий по описанию, у Opus 4.8 69,7 против 57,7. Всё это цифры самой DeepSeek. Текстовые тесты она запускала в собственной агентной среде с максимальным уровнем рассуждений.

Вместе с весами в репозитории лежат токенизатор, описание формата запросов и минимальная реализация на PyTorch. Модель можно запустить через vLLM или SGLang. Пример в карточке рассчитан на один сервер с четырьмя ускорителями Nvidia GB300, так что на домашнем компьютере она не заработает.

В начале августа текстовая V4 Flash появилась у поставщиков инференса на Hugging Face, но тогда там были только текстовые модели. Выйдет ли зрение в основной версии V4 и когда, DeepSeek не сообщает.

← Все новости