ИИтак

← Назад

Модель · DeepSeek

DeepSeek V4 Flash Vision Exp

Устаревшая экспериментальная версия V4 Flash, которая понимает картинки, для агентов. Её сменила V4.1 Flash

вышла 21 августа

Характеристики

Вышла
21 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 384 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,003 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,60 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
май 2025
Идентификатор в API
deepseek-v4-flash-vision-exp

Что это за модель

DeepSeek V4 Flash Vision Exp — первая экспериментальная мультимодальная модель в линейке DeepSeek V4, то есть первая, которая работает не только с текстом, но и с изображениями. Лаборатория взяла языковую основу DeepSeek V4 Flash и добавила к ней визуальный кодировщик — модуль, который переводит картинку в понятное модели представление. Затем модель дообучили понимать изображения. Устроена она как смесь экспертов (mixture of experts): всего в ней около 305 млрд параметров, но на каждый токен работает лишь малая часть из них. Веса выложены на Hugging Face под лицензией MIT, она разрешает и коммерческое применение.

По словам DeepSeek, в текстовых задачах модель держится на уровне обычной V4 Flash: в работе агентов, рассуждениях и знаниях о мире. Разница видна в мультимодальных агентных задачах, где нужно одновременно разбирать картинки и вызывать инструменты. Прежняя V4 Flash изображения во входных данных просто игнорировала. Компания заявляет, что Vision Exp здесь заметно её обходит и приближается к Claude Opus 4.8. В карточке модели указано 36,5 балла в ApexBench и 83,9 в Terminal Bench 2.1. На части тестов Opus 4.8 остаётся впереди: например, в NL2Repo у него 69,7 против 57,7.

Модель брали, чтобы разбирать документы и графики, отвечать на вопросы по снимкам экрана и фотографиям и строить агентов, которые смотрят на изображения по ходу работы. Картинки оплачиваются как текст: каждая превращается не более чем в 384 токена по тарифу V4 Flash. Вместе с моделью DeepSeek запустила бесплатный файловый API: изображение можно загрузить один раз и потом ссылаться на него в разных запросах.

Модель с самого начала вышла как экспериментальная и работала недолго. Когда вышла V4.1 Flash, которая сама понимает картинки, DeepSeek вывела Vision Exp из работы. Старое имя в API ещё принимается, но запросы к нему теперь обрабатывает актуальная модель Flash. Для новых проектов лаборатория советует обращаться к ней напрямую.

Источники: Анонс DeepSeek, Карточка модели на Hugging Face, Документация: работа с изображениями

Другие модели семейства

Новости о модели

  1. 01

    «Интеллект растёт экспоненциально»: Маск о малых открытых моделях, обошедших лидеров 2025 года

    Илон Маск

  2. 02

    Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки

    Яндекс

  3. 03

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

  4. 04

    DeepSeek V4.1-Flash в независимых тестах: очень многословна, но всё равно дешевле всех

    Latent Space

  5. 05

    DeepSeek открыла веса V4.1-Flash: на 552 млрд параметров, но с очень лёгкой памятью контекста

    DeepSeek · HF

  6. 06

    DeepSeek выпустила V4.1-Flash и отключает свой флагман V4-Pro: младшая модель оказалась лучше

    DeepSeek

все 12 новостей о DeepSeek V4 →

Данные: models.dev (MIT).