Модель · DeepSeek
DeepSeek V4 Flash Vision Exp
Устаревшая экспериментальная версия V4 Flash, которая понимает картинки, для агентов. Её сменила V4.1 Flash
вышла 21 августа
Характеристики
- Вышла
- 21 августа
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 384 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,15 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,003 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,60 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- май 2025
- Идентификатор в API
- deepseek-v4-flash-vision-exp
Что это за модель
DeepSeek V4 Flash Vision Exp — первая экспериментальная мультимодальная модель в линейке DeepSeek V4, то есть первая, которая работает не только с текстом, но и с изображениями. Лаборатория взяла языковую основу DeepSeek V4 Flash и добавила к ней визуальный кодировщик — модуль, который переводит картинку в понятное модели представление. Затем модель дообучили понимать изображения. Устроена она как смесь экспертов (mixture of experts): всего в ней около 305 млрд параметров, но на каждый токен работает лишь малая часть из них. Веса выложены на Hugging Face под лицензией MIT, она разрешает и коммерческое применение.
По словам DeepSeek, в текстовых задачах модель держится на уровне обычной V4 Flash: в работе агентов, рассуждениях и знаниях о мире. Разница видна в мультимодальных агентных задачах, где нужно одновременно разбирать картинки и вызывать инструменты. Прежняя V4 Flash изображения во входных данных просто игнорировала. Компания заявляет, что Vision Exp здесь заметно её обходит и приближается к Claude Opus 4.8. В карточке модели указано 36,5 балла в ApexBench и 83,9 в Terminal Bench 2.1. На части тестов Opus 4.8 остаётся впереди: например, в NL2Repo у него 69,7 против 57,7.
Модель брали, чтобы разбирать документы и графики, отвечать на вопросы по снимкам экрана и фотографиям и строить агентов, которые смотрят на изображения по ходу работы. Картинки оплачиваются как текст: каждая превращается не более чем в 384 токена по тарифу V4 Flash. Вместе с моделью DeepSeek запустила бесплатный файловый API: изображение можно загрузить один раз и потом ссылаться на него в разных запросах.
Модель с самого начала вышла как экспериментальная и работала недолго. Когда вышла V4.1 Flash, которая сама понимает картинки, DeepSeek вывела Vision Exp из работы. Старое имя в API ещё принимается, но запросы к нему теперь обрабатывает актуальная модель Flash. Для новых проектов лаборатория советует обращаться к ней напрямую.
Источники: Анонс DeepSeek, Карточка модели на Hugging Face, Документация: работа с изображениями
Другие модели семейства
-
DeepSeek V4.1 Flash
DeepSeekконтекст 1 млн$0,15 / $0,60открытые весарассуждения
-
DeepSeek V4 Flash
DeepSeek69-е место в Epochконтекст 1 млн$0,15 / $0,60открытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).