Новости· 01.09.2026· 3 мин чтения

DeepSeek-V4-Flash-Vision-Exp вышла с MIT-лицензией — первая мультимодальная модель в линейке V4

DeepSeek выпустил первую мультимодальную модель в линейке V4-Flash. Разбираем архитектуру, бенчмарки и команды запуска через vLLM и SGLang.

📰
PL
Материал подготовлен с помощью ИИ и проверен редактором

DeepSeek выпустил DeepSeek-V4-Flash-Vision-Exp — первый экспериментальный мультимодальный релиз в семействе V4-Flash. Модель понимает изображения, сохраняет текстовые способности предшественника и, по заявлению разработчиков, по агентным задачам с визуальным вводом приближается к Claude Opus 4.8.

Что это за модель и откуда она взялась

DeepSeek-V4-Flash-Vision-Exp строится на архитектуре DeepSeek-V4-Flash — быстрой «флеш»-версии четвёртого поколения. К ней добавили визуальные модули и провели дополнительное обучение (continued training), чтобы разблокировать понимание изображений. Это не отдельная модель с нуля, а надстройка над уже работающим текстовым движком.

Внутри — классическая для DeepSeek связка: MoE (Mixture of Experts, архитектура с набором специализированных подсетей, из которых активируется только часть), DFlash attention, Hyper-Connections и DSpark — собственный механизм спекулятивной генерации (черновик токенов для ускорения вывода). Визуальная часть реализована через отдельный энкодер и алайнер, которые «переводят» патчи изображения в токены текстового потока.

Задача модели — image-text-to-text: на вход картинка и текст, на выход текст. Основной фокус — агенты, которым нужно работать с визуальным контентом: разбирать скриншоты интерфейсов, таблицы, схемы, диаграммы. Доступна через DeepSeek API Platform.

Цифры: что говорят бенчмарки

Карточка модели содержит сравнение с DeepSeek-V4-Flash-0731 по двум группам задач. Ключевое утверждение: на мультимодальных агентных бенчмарках (ApexBench и Agents' Last Exam) новая модель показывает существенный прирост, тогда как на чисто текстовых агентных задачах результат сопоставим с предшественником.

Важная оговорка из карточки: DeepSeek-V4-Flash-0731 на задачах ApexBench и Agents' Last Exam просто игнорировал визуальные элементы в промпте — то есть сравнение отчасти некорректное по условиям. Конкретные числовые значения бенчмарков в README не приведены — только текстовое описание динамики. По данным из сторонних источников, результаты приближаются к уровню Claude Opus 4.8 на мультимодальных агентных задачах, но независимой проверки этих цифр в карточке нет.

Для оценки используется DeepSeek Harness в режиме minimal с параметрами temperature = 1.0, top_p = 0.95 и уровнем рассуждений max.

Лицензия: MIT, без ограничений

Репозиторий выходит под MIT License. Это означает полную свободу: коммерческое использование разрешено, модификации разрешены, требование одно — сохранить упоминание лицензии. Для open-source-проекта такого масштаба это нетипично мягко.

Что нужно, чтобы запустить

В карточке указан один конкретный референсный конфиг: 4× NVIDIA GB300 на одном узле. GB300 — это серверные GPU следующего поколения с HBM3e, не потребительский сегмент. Конкретные цифры VRAM в README не прописаны, квантованных версий в карточке не упомянуто, хотя флаг --kv-cache-dtype fp8 в команде vLLM намекает, что fp8-кэш поддерживается и снижает потребление памяти.

SGLang-рецепт в документации ссылается на конфигурации для B200, что тоже указывает на серверный класс железа. Для запуска на потребительских GPU официальных инструкций нет.

Репозиторий включает: токенайзер, референсный PyTorch-инференс (vision encoder, aligner, MoE, Hyper-Connections, DSpark), примеры промптов в форматах TXT и JSON. Поддерживается как OpenAI-style JSON content blocks, так и компактная нотация <image>path</image>.

Команды запуска

vLLM (4× GB300, один узел):

bash
docker run --gpus all \
  vllm/vllm-openai:deepseekv4-flash-vision deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --tensor-parallel-size 4 \
  --tool-call-parser deepseek_v4 \
  --enable-auto-tool-choice \
  --reasoning-parser deepseek_v4 \
  --reasoning-config '{"reasoning_parser":"deepseek_v4","reasoning_start_str":"","reasoning_end_str":""}' \
  --speculative-config '{"method":"dspark","model":"deepseek-ai/DeepSeek-V4-Flash-Vision-Exp","num_speculative_tokens":3,"draft_sample_method":"probabilistic","enable_adaptive_verification":true}'

SGLang (tp=4, DSpark включён):

bash
sglang serve \
  --model-path deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
  --tp 4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.85 \
  --host 0.0.0.0 \
  --port 30000

В SGLang отдельная draft-модель не нужна: флаг --speculative-algorithm DSPARK использует тот же чекпоинт и для target, и для draft. Детальные рецепты под конкретное железо — на странице vLLM Recipes и в cookbook SGLang.

Стоит ли брать

Модель интересна командам, которые строят визуальных агентов и уже работают в экосистеме DeepSeek: MIT-лицензия снимает юридические ограничения, DSpark ускоряет инференс без отдельной модели-черновика. Текстовые способности при добавлении зрения не деградировали — это принципиально для агентных сценариев, где картинка и текст идут вместе.

Тем, кто рассчитывает запустить модель на потребительском железе самостоятельно, придётся ждать: официальных инструкций под RTX-карты нет, числа по VRAM отсутствуют, а референсный конфиг завязан на GB300. Пока это история про API-доступ или серверный self-hosting.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.