DeepSeek-V4-Flash-Vision-Exp вышла с MIT-лицензией — первая мультимодальная модель в линейке V4
DeepSeek выпустил первую мультимодальную модель в линейке V4-Flash. Разбираем архитектуру, бенчмарки и команды запуска через vLLM и SGLang.
DeepSeek выпустил DeepSeek-V4-Flash-Vision-Exp — первый экспериментальный мультимодальный релиз в семействе V4-Flash. Модель понимает изображения, сохраняет текстовые способности предшественника и, по заявлению разработчиков, по агентным задачам с визуальным вводом приближается к Claude Opus 4.8.
Что это за модель и откуда она взялась
DeepSeek-V4-Flash-Vision-Exp строится на архитектуре DeepSeek-V4-Flash — быстрой «флеш»-версии четвёртого поколения. К ней добавили визуальные модули и провели дополнительное обучение (continued training), чтобы разблокировать понимание изображений. Это не отдельная модель с нуля, а надстройка над уже работающим текстовым движком.
Внутри — классическая для DeepSeek связка: MoE (Mixture of Experts, архитектура с набором специализированных подсетей, из которых активируется только часть), DFlash attention, Hyper-Connections и DSpark — собственный механизм спекулятивной генерации (черновик токенов для ускорения вывода). Визуальная часть реализована через отдельный энкодер и алайнер, которые «переводят» патчи изображения в токены текстового потока.
Задача модели — image-text-to-text: на вход картинка и текст, на выход текст. Основной фокус — агенты, которым нужно работать с визуальным контентом: разбирать скриншоты интерфейсов, таблицы, схемы, диаграммы. Доступна через DeepSeek API Platform.
Цифры: что говорят бенчмарки
Карточка модели содержит сравнение с DeepSeek-V4-Flash-0731 по двум группам задач. Ключевое утверждение: на мультимодальных агентных бенчмарках (ApexBench и Agents' Last Exam) новая модель показывает существенный прирост, тогда как на чисто текстовых агентных задачах результат сопоставим с предшественником.
Важная оговорка из карточки: DeepSeek-V4-Flash-0731 на задачах ApexBench и Agents' Last Exam просто игнорировал визуальные элементы в промпте — то есть сравнение отчасти некорректное по условиям. Конкретные числовые значения бенчмарков в README не приведены — только текстовое описание динамики. По данным из сторонних источников, результаты приближаются к уровню Claude Opus 4.8 на мультимодальных агентных задачах, но независимой проверки этих цифр в карточке нет.
Для оценки используется DeepSeek Harness в режиме minimal с параметрами temperature = 1.0, top_p = 0.95 и уровнем рассуждений max.
Лицензия: MIT, без ограничений
Репозиторий выходит под MIT License. Это означает полную свободу: коммерческое использование разрешено, модификации разрешены, требование одно — сохранить упоминание лицензии. Для open-source-проекта такого масштаба это нетипично мягко.
Что нужно, чтобы запустить
В карточке указан один конкретный референсный конфиг: 4× NVIDIA GB300 на одном узле. GB300 — это серверные GPU следующего поколения с HBM3e, не потребительский сегмент. Конкретные цифры VRAM в README не прописаны, квантованных версий в карточке не упомянуто, хотя флаг --kv-cache-dtype fp8 в команде vLLM намекает, что fp8-кэш поддерживается и снижает потребление памяти.
SGLang-рецепт в документации ссылается на конфигурации для B200, что тоже указывает на серверный класс железа. Для запуска на потребительских GPU официальных инструкций нет.
Репозиторий включает: токенайзер, референсный PyTorch-инференс (vision encoder, aligner, MoE, Hyper-Connections, DSpark), примеры промптов в форматах TXT и JSON. Поддерживается как OpenAI-style JSON content blocks, так и компактная нотация <image>path</image>.
Команды запуска
vLLM (4× GB300, один узел):
docker run --gpus all \
vllm/vllm-openai:deepseekv4-flash-vision deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--kv-cache-dtype fp8 \
--block-size 256 \
--tensor-parallel-size 4 \
--tool-call-parser deepseek_v4 \
--enable-auto-tool-choice \
--reasoning-parser deepseek_v4 \
--reasoning-config '{"reasoning_parser":"deepseek_v4","reasoning_start_str":"","reasoning_end_str":""}' \
--speculative-config '{"method":"dspark","model":"deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","num_speculative_tokens":3,"draft_sample_method":"probabilistic","enable_adaptive_verification":true}'SGLang (tp=4, DSpark включён):
sglang serve \
--model-path deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--tp 4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.85 \
--host 0.0.0.0 \
--port 30000В SGLang отдельная draft-модель не нужна: флаг --speculative-algorithm DSPARK использует тот же чекпоинт и для target, и для draft. Детальные рецепты под конкретное железо — на странице vLLM Recipes и в cookbook SGLang.
Стоит ли брать
Модель интересна командам, которые строят визуальных агентов и уже работают в экосистеме DeepSeek: MIT-лицензия снимает юридические ограничения, DSpark ускоряет инференс без отдельной модели-черновика. Текстовые способности при добавлении зрения не деградировали — это принципиально для агентных сценариев, где картинка и текст идут вместе.
Тем, кто рассчитывает запустить модель на потребительском железе самостоятельно, придётся ждать: официальных инструкций под RTX-карты нет, числа по VRAM отсутствуют, а референсный конфиг завязан на GB300. Пока это история про API-доступ или серверный self-hosting.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

