← На главную
Новости· 13.08.2026· 5 мин чтения

DeepSeek-V4-Pro-0813: официальный релиз флагмана с DSpark-декодированием

Разбор релиза DeepSeek-V4-Pro-0813: DSpark-декодирование, бенчмарки, лицензия MIT и команды запуска на vLLM и SGLang.

DeepSeek-V4-Pro-0813: официальный релиз флагмана с DSpark-декодированием
Материал подготовлен с помощью ИИ и проверен редактором

DeepSeek выложила на Hugging Face финальную версию своей флагманской модели — DeepSeek-V4-Pro-0813. Это стабилизированный релиз V4-Pro вместо превью: сверху на той же архитектуре висит модуль спекулятивного декодирования DSpark, а у модели теперь три уровня рассуждений — low, high и max. Рассказываю, что изменилось, что заявлено в бенчмарках и как запускать модель на vLLM и SGLang.

Что это за модель и почему 0813, а не просто V4-Pro

DeepSeek-V4-Pro-0813 — это полноценный релиз вместо DeepSeek-V4-Pro (Preview). Судя по описанию, архитектура не меняется: модель построена на структуре превью, но к ней добавлен модуль спекулятивного декодирования DSpark. Выход весов состоялся 13 августа 2026 года — через 13 дней после DeepSeek-V4-Flash-0731.

Пайплайн у модели text-generation. В карточке заявлена задача agentic-сценариев: автономная работа с инструментами, кодом, терминалом. Это подтверждают бенчмарки: AutomationBench, Terminal-Bench 2.1, Toolathlon-Verified, CyberGym. Если коротко — модель заточена под то, чтобы её использовали как агента, а не как простого чат-бота.

В поисковых сводках модель проходит как крупномасштабная mixture-of-experts сеть с 1,6 трлн параметров. Контекст — 1 048 576 токенов, максимальный выход — 384 000 токенов. Цифры внушительные, но в README у них веса уже близки к «производственный запуск».

Ключевое техническое изменение — DSpark: спекулятивный декодер, который предсказывает несколько токенов параллельно, ускоряя генерацию. Он встроен в веса модели, поэтому для vLLM и SGLang достаточно включить специальный флаг — отдельную модель-черновик не нужно.

Почему в карточке нет таблицы с цифрами

В README упоминается, что модель превосходит Preview на перечисленных ниже бенчмарках, но сама таблица в карточке не раскрыта. Из текста ясно, что превосходит она по десяти параметрам агентных оценки и «в целом находится на уровне сильнейших проприетарных моделей». Формально карточка не содержит ни одной цифры тестов — только формулировки. Поэтому если вы ждали сравнение в процентах — технический отчёт к модели это отдельная сущность, ссылки на неё в README указывают.

Что в карточке действительно указано, это условие оценки: для code-agent задач модель гонялась в минимальном режиме DeepSeek Harness с уровнем рассуждения max, temperature=1.0 и top_p=0.95. Также упоминаются внутренние наборы DSBench-FullStack и DSBench-Hard — без цифр. Так что прозрачности по точным числам в публичной карточке нет. Для подробностей придётся дождаться официальной выхода бенчмарка.

Особенность, о которой не думаешь: нет стандартного chat template

Обычно у моделей стоит шаблон Jinja, превращающий список сообщений в строку промпта. У DeepSeek-V4-Pro-0813 его нет. Вместо этого в репозитории лежит папка encoding с Python-скриптом, который конвертирует сообщения в OpenAI-совместимом формате во входную строку модели и разбирает выходной текст.

Выглядит это так: импортируем encode_messages, передаём историю и параметры, получаем готовый промпт. Важн важно, что у модели появился параметр reasoning_effort с уровнями low, high и max. Он управляет количеством «размышлений» перед ответом — по аналогии с o1-подобными моделями.

```python from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [ {"role": "user", "content": "hello"}, {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."}, {"role": "user", "content": "1+1=?"} ]

messages -> string

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")

string -> tokens

import transformers tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Pro-0813") tokens = tokenizer.encode(prompt) ```

Твой стек теперь должен понимать стандартный OpenAI-диалог и уметь конвертировать его в этот формат через скрипт. Никакого магического встраивания в токенизаторе.

Лицензия MIT — можно всё, включая коммерцию

DeepSeek-V4-Pro-0813 работает под честной лицензией MIT. Это даёт право на любое использование включая модификацию и распространение, без ограничений на коммерческую эксплуатацию. Для модели уровня, видимо не типично: большинство конкурентов класса MoE имеют открытые веса, но с оговорками — у DeepSeek здесь просто разрешающий текст.

Так что юридический барьер из управления почти снят: можно поднять модель у себя, встроить в продукт, даже перепродать сервис на её основе — не требуя рекламного соглашения отдельно.

Какое железо требует флагман

Карточка явный ответов на вопрос «какой минимум VRAM» не даёт. Это первый раз, когда COPY подходит тактично: для запуска под указанным в vLLM дано оборудование — единичный node из 4×GB300. То есть это не карточник, а серверное решение: четыре ускорителя NVIDIA на узле — класс Grace Blackwell GB300.

Сама модель 1,6 трлн параметров, поэтому даже в низко-битного формате параметров нужны терабайты памяти: например, FP8-вес в 1,6 ТБ — совпадение с рекламным количеством памяти GB300. То есть для локального запуска без quantей и нет.

В карточке также есть отдельная папка inference с документацией по запуску — включая конвертацию весов и выбор интерактивного чата. Об том упомянуто, что для high и max волей-расхода надо рекомендовать максимальную длину 384К токенов.

Как запускать: команды из карточки

vLLM и SGLang в описании рассмотрены отдельными сценариями. Оба способа поддерживают DSpark без догрузки отдельного draft-модели.

Для запуска в vLLM необходимо добавить в команду флаг --speculative-config с методом dspark. Из примера — на одном 4× GB300 узла:

``bash vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}' \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ``

Аналогичный вариант в SGLang: указываем --speculative-algorithm DSPARK без отдельного --speculative-draft-model-path:

``bash sglang serve \ --trust-remote-code \ --model-path deepseek-ai/DeepSeek-V4-Pro-0813 \ --tp 4 \ --moe-runner-backend flashinfer_mxfp4 \ --speculative-algorithm DSPARK \ --mem-fraction-static 0.90 \ --chunked-prefill-size 4096 \ --swa-full-tokens-ratio 0.1 ``

Для остальных hardware-конфигураций vLLM и SGLang дают ссылки на сверяемые рецепты и cookbook. В карточке delle исполняем рекомендованный режимы: temperature=1.0, top_p=0.95 для агентных сценариев и top_p=1.0 обычно.

Стоит ли брать

DeepSeek-V4-Pro-0813 — это модель для команд, которые уже строят агентные пайплайны на большом масштабе и имеют серверные мощности уровня multi-GB300. В таких условиях DSpark и 1M-контекст дают конкурентное преимущество, а MIT-лицензия снимает юридические вопросы. Если у вас нет кластера под веса, но есть потребность в мощи, выгоднее пока пользоваться API OpenRouter — там вход стоит 0,435 доллара за млн токенов, а результат — 0,87. А вот ждать домашнюю версию не стоит: старту философия этой модели — продукция.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

DeepSeek-V4-Pro-0813: официальный релиз флагмана — PLai