# DeepSeek-V4-Flash-Vision-Exp вышла с MIT-лицензией — первая мультимодальная модель в линейке V4
Каноническая страница: https://plainews.ru/posts/deepseek-v4-flash-vision-exp-release
Опубликовано: 2026-09-01T11:01:11.852Z

DeepSeek выпустил первую мультимодальную модель в линейке V4-Flash. Разбираем архитектуру, бенчмарки и команды запуска через vLLM и SGLang.
DeepSeek выпустил DeepSeek-V4-Flash-Vision-Exp — первый экспериментальный мультимодальный релиз в семействе V4-Flash. Модель понимает изображения, сохраняет текстовые способности предшественника и, по заявлению разработчиков, по агентным задачам с визуальным вводом приближается к Claude Opus 4.8.

## Что это за модель и откуда она взялась

DeepSeek-V4-Flash-Vision-Exp строится на архитектуре DeepSeek-V4-Flash — быстрой «флеш»-версии четвёртого поколения. К ней добавили визуальные модули и провели дополнительное обучение (continued training), чтобы разблокировать понимание изображений. Это не отдельная модель с нуля, а надстройка над уже работающим текстовым движком.

Внутри — классическая для DeepSeek связка: MoE (Mixture of Experts, архитектура с набором специализированных подсетей, из которых активируется только часть), DFlash attention, Hyper-Connections и DSpark — собственный механизм спекулятивной генерации (черновик токенов для ускорения вывода). Визуальная часть реализована через отдельный энкодер и алайнер, которые «переводят» патчи изображения в токены текстового потока.

Задача модели — image-text-to-text: на вход картинка и текст, на выход текст. Основной фокус — агенты, которым нужно работать с визуальным контентом: разбирать скриншоты интерфейсов, таблицы, схемы, диаграммы. Доступна через DeepSeek API Platform.

## Цифры: что говорят бенчмарки

Карточка модели содержит сравнение с DeepSeek-V4-Flash-0731 по двум группам задач. Ключевое утверждение: на мультимодальных агентных бенчмарках (ApexBench и Agents' Last Exam) новая модель показывает существенный прирост, тогда как на чисто текстовых агентных задачах результат сопоставим с предшественником.

Важная оговорка из карточки: DeepSeek-V4-Flash-0731 на задачах ApexBench и Agents' Last Exam просто игнорировал визуальные элементы в промпте — то есть сравнение отчасти некорректное по условиям. Конкретные числовые значения бенчмарков в README не приведены — только текстовое описание динамики. По данным из сторонних источников, результаты приближаются к уровню Claude Opus 4.8 на мультимодальных агентных задачах, но независимой проверки этих цифр в карточке нет.

Для оценки используется DeepSeek Harness в режиме minimal с параметрами temperature = 1.0, top_p = 0.95 и уровнем рассуждений max.

## Лицензия: MIT, без ограничений

Репозиторий выходит под MIT License. Это означает полную свободу: коммерческое использование разрешено, модификации разрешены, требование одно — сохранить упоминание лицензии. Для open-source-проекта такого масштаба это нетипично мягко.

## Что нужно, чтобы запустить

В карточке указан один конкретный референсный конфиг: **4× NVIDIA GB300** на одном узле. GB300 — это серверные GPU следующего поколения с HBM3e, не потребительский сегмент. Конкретные цифры VRAM в README не прописаны, квантованных версий в карточке не упомянуто, хотя флаг --kv-cache-dtype fp8 в команде vLLM намекает, что fp8-кэш поддерживается и снижает потребление памяти.

SGLang-рецепт в документации ссылается на конфигурации для B200, что тоже указывает на серверный класс железа. Для запуска на потребительских GPU официальных инструкций нет.

Репозиторий включает: токенайзер, референсный PyTorch-инференс (vision encoder, aligner, MoE, Hyper-Connections, DSpark), примеры промптов в форматах TXT и JSON. Поддерживается как OpenAI-style JSON content blocks, так и компактная нотация <image>path</image>.

## Команды запуска

**vLLM** (4× GB300, один узел):

**SGLang** (tp=4, DSpark включён):

В SGLang отдельная draft-модель не нужна: флаг --speculative-algorithm DSPARK использует тот же чекпоинт и для target, и для draft. Детальные рецепты под конкретное железо — на странице vLLM Recipes и в cookbook SGLang.

## Стоит ли брать

Модель интересна командам, которые строят визуальных агентов и уже работают в экосистеме DeepSeek: MIT-лицензия снимает юридические ограничения, DSpark ускоряет инференс без отдельной модели-черновика. Текстовые способности при добавлении зрения не деградировали — это принципиально для агентных сценариев, где картинка и текст идут вместе.

Тем, кто рассчитывает запустить модель на потребительском железе самостоятельно, придётся ждать: официальных инструкций под RTX-карты нет, числа по VRAM отсутствуют, а референсный конфиг завязан на GB300. Пока это история про API-доступ или серверный self-hosting.

## Источники

- HF Releases: DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — открытые веса модели
