# DeepSeek-V4-Pro-0813: официальный релиз флагмана с DSpark-декодированием
Каноническая страница: https://plainews.ru/posts/deepseek-v4-pro-0813-obzor-reliza
Опубликовано: 2026-08-13T19:17:45.830Z

Разбор релиза DeepSeek-V4-Pro-0813: DSpark-декодирование, бенчмарки, лицензия MIT и команды запуска на vLLM и SGLang.
DeepSeek выложила на Hugging Face финальную версию своей флагманской модели — DeepSeek-V4-Pro-0813. Это стабилизированный релиз V4-Pro вместо превью: сверху на той же архитектуре висит модуль спекулятивного декодирования DSpark, а у модели теперь три уровня рассуждений — low, high и max. Рассказываю, что изменилось, что заявлено в бенчмарках и как запускать модель на vLLM и SGLang.

## Что это за модель и почему 0813, а не просто V4-Pro

DeepSeek-V4-Pro-0813 — это полноценный релиз вместо DeepSeek-V4-Pro (Preview). Судя по описанию, архитектура не меняется: модель построена на структуре превью, но к ней добавлен модуль спекулятивного декодирования DSpark. Выход весов состоялся 13 августа 2026 года — через 13 дней после DeepSeek-V4-Flash-0731.

Пайплайн у модели text-generation. В карточке заявлена задача agentic-сценариев: автономная работа с инструментами, кодом, терминалом. Это подтверждают бенчмарки: AutomationBench, Terminal-Bench 2.1, Toolathlon-Verified, CyberGym. Если коротко — модель заточена под то, чтобы её использовали как агента, а не как простого чат-бота.

В поисковых сводках модель проходит как крупномасштабная mixture-of-experts сеть с 1,6 трлн параметров. Контекст — 1 048 576 токенов, максимальный выход — 384 000 токенов. Цифры внушительные, но в README у них веса уже близки к «производственный запуск».

Ключевое техническое изменение — DSpark: спекулятивный декодер, который предсказывает несколько токенов параллельно, ускоряя генерацию. Он встроен в веса модели, поэтому для vLLM и SGLang достаточно включить специальный флаг — отдельную модель-черновик не нужно.

## Почему в карточке нет таблицы с цифрами

В README упоминается, что модель превосходит Preview на перечисленных ниже бенчмарках, но сама таблица в карточке не раскрыта. Из текста ясно, что превосходит она по десяти параметрам агентных оценки и «в целом находится на уровне сильнейших проприетарных моделей». Формально карточка не содержит ни одной цифры тестов — только формулировки. Поэтому если вы ждали сравнение в процентах — технический отчёт к модели это отдельная сущность, ссылки на неё в README указывают.

Что в карточке действительно указано, это условие оценки: для code-agent задач модель гонялась в минимальном режиме DeepSeek Harness с уровнем рассуждения max, temperature=1.0 и top_p=0.95. Также упоминаются внутренние наборы DSBench-FullStack и DSBench-Hard — без цифр. Так что прозрачности по точным числам в публичной карточке нет. Для подробностей придётся дождаться официальной выхода бенчмарка.

## Особенность, о которой не думаешь: нет стандартного chat template

Обычно у моделей стоит шаблон Jinja, превращающий список сообщений в строку промпта. У DeepSeek-V4-Pro-0813 его нет. Вместо этого в репозитории лежит папка encoding с Python-скриптом, который конвертирует сообщения в OpenAI-совместимом формате во входную строку модели и разбирает выходной текст.

Выглядит это так: импортируем encode_messages, передаём историю и параметры, получаем готовый промпт. Важн важно, что у модели появился параметр reasoning_effort с уровнями low, high и max. Он управляет количеством «размышлений» перед ответом — по аналогии с o1-подобными моделями.

```python from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [     {"role": "user", "content": "hello"},     {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."},     {"role": "user", "content": "1+1=?"} ]

# messages -> string

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")

# string -> tokens

import transformers tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Pro-0813") tokens = tokenizer.encode(prompt) ```

Твой стек теперь должен понимать стандартный OpenAI-диалог и уметь конвертировать его в этот формат через скрипт. Никакого магического встраивания в токенизаторе.

## Лицензия MIT — можно всё, включая коммерцию

DeepSeek-V4-Pro-0813 работает под честной лицензией MIT. Это даёт право на любое использование включая модификацию и распространение, без ограничений на коммерческую эксплуатацию. Для модели уровня, видимо не типично: большинство конкурентов класса MoE имеют открытые веса, но с оговорками — у DeepSeek здесь просто разрешающий текст.

Так что юридический барьер из управления почти снят: можно поднять модель у себя, встроить в продукт, даже перепродать сервис на её основе — не требуя рекламного соглашения отдельно.

## Какое железо требует флагман

Карточка явный ответов на вопрос «какой минимум VRAM» не даёт. Это первый раз, когда COPY подходит тактично: для запуска под указанным в vLLM дано оборудование — единичный node из 4×GB300. То есть это не карточник, а серверное решение: четыре ускорителя NVIDIA на узле — класс Grace Blackwell GB300.

Сама модель 1,6 трлн параметров, поэтому даже в низко-битного формате параметров нужны терабайты памяти: например, FP8-вес в 1,6 ТБ — совпадение с рекламным количеством памяти GB300. То есть для локального запуска без quantей и нет.

В карточке также есть отдельная папка inference с документацией по запуску — включая конвертацию весов и выбор интерактивного чата. Об том упомянуто, что для high и max волей-расхода надо рекомендовать максимальную длину 384К токенов.

## Как запускать: команды из карточки

vLLM и SGLang в описании рассмотрены отдельными сценариями. Оба способа поддерживают DSpark без догрузки отдельного draft-модели.

Для запуска в vLLM необходимо добавить в команду флаг --speculative-config с методом dspark. Из примера — на одном 4× GB300 узла:

``bash vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \   --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \   --data-parallel-size 4 --enable-expert-parallel \   --moe-backend deep_gemm_mega_moe \   --attention-config '{"use_fp4_indexer_cache": true}' \   --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ``

Аналогичный вариант в SGLang: указываем --speculative-algorithm DSPARK без отдельного --speculative-draft-model-path:

``bash sglang serve \   --trust-remote-code \   --model-path deepseek-ai/DeepSeek-V4-Pro-0813 \   --tp 4 \   --moe-runner-backend flashinfer_mxfp4 \   --speculative-algorithm DSPARK \   --mem-fraction-static 0.90 \   --chunked-prefill-size 4096 \   --swa-full-tokens-ratio 0.1 ``

Для остальных hardware-конфигураций vLLM и SGLang дают ссылки на сверяемые рецепты и cookbook. В карточке delle исполняем рекомендованный режимы: temperature=1.0, top_p=0.95 для агентных сценариев и top_p=1.0 обычно.

## Стоит ли брать

DeepSeek-V4-Pro-0813 — это модель для команд, которые уже строят агентные пайплайны на большом масштабе и имеют серверные мощности уровня multi-GB300. В таких условиях DSpark и 1M-контекст дают конкурентное преимущество, а MIT-лицензия снимает юридические вопросы. Если у вас нет кластера под веса, но есть потребность в мощи, выгоднее пока пользоваться API OpenRouter — там вход стоит 0,435 доллара за млн токенов, а результат — 0,87. А вот ждать домашнюю версию не стоит: старту философия этой модели — продукция.

## Источники

- HF Releases: DeepSeek выпустила DeepSeek-V4-Pro-0813 — открытые веса модели
