# DeepSeek выпустил V4-Flash-0731 — агентная модель обошла собственный V4-Pro на бенчмарках
Каноническая страница: https://plainews.ru/posts/deepseek-v4-flash-0731-official-release
Опубликовано: 2026-07-31T14:00:53.382Z

DeepSeek выпустил официальную версию V4-Flash с усиленными агентными способностями. Модель обгоняет V4-Pro на кодогенерации и работает с контекстом в 1 млн токенов.
DeepSeek опубликовал финальную версию V4-Flash (билд 0731) — mixture-of-experts модель на 284 миллиарда параметров с контекстом в 1 миллион токенов. Главное изменение — дообучение на агентных задачах: модель теперь превосходит DeepSeek-V4-Pro (Preview) на публичных бенчмарках, несмотря на меньшее количество активных параметров. В команде заявляют, что V4-Flash конкурирует с проприетарными фронтирными моделями, а по соотношению производительность/цена опережает их.

## Что изменилось с preview-версии

Архитектура осталась прежней — это та же MoE-модель с модулем спекулятивного декодирования (DSpark), что и в DeepSeek-V4-Flash-DSpark. Обновление коснулось только post-training: модель переобучили с акцентом на агентные сценарии, кодогенерацию и работу с инструментами.

На внутренних бенчмарках DeepSeek результаты выросли заметно: на DSBench-FullStack (тесты на полный цикл разработки) и DSBench-Hard (сложные задачи для code-агентов) модель показывает результаты, которые команда не публикует в числах, но называет «substantially enhanced». На публичных наборах V4-Flash-0731 обгоняет V4-Pro (Preview), хотя активирует меньше параметров на каждый запрос.

Важная деталь: для code-агентных задач в публичных бенчмарках модель тестировали в режиме max reasoning effort с температурой 1.0 и top_p 0.95, используя фреймворк DeepSeek Harness (пока не выложен публично).

## Reasoning effort — три уровня обдумывания

В модели появился параметр reasoning_effort с тремя значениями: low, high, max. Это управляет тем, сколько времени модель тратит на размышления перед ответом. Для максимального уровня DeepSeek рекомендует выставлять лимит генерации в 384 тысячи токенов — это почти треть полного контекста в миллион.

Параметр работает через специальный формат сообщений: вместо стандартного Jinja-шаблона DeepSeek предоставляет Python-скрипты в папке encoding для кодирования OpenAI-совместимых сообщений в строки и парсинга ответов. Пример:

```python from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [     {"role": "user", "content": "1+1=?"} ]

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max") ```

Для агентных сценариев команда советует температуру 1.0 и top_p 0.95, для остальных — top_p 1.0.

## Как запустить

Модель работает через vLLM с включённым спекулятивным декодированием DSpark. Это делается одним флагом --speculative-config с параметрами метода, количества спекулятивных токенов и режима сэмплирования драфта.

Пример команды для одной ноды с 4×GB300 (это карты Nvidia Blackwell с большим объёмом памяти):

``bash vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \   --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \   --data-parallel-size 4 --enable-expert-parallel \   --moe-backend deep_gemm_mega_moe \   --attention-config '{"use_fp4_indexer_cache": true}' \   --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ``

Флаг --kv-cache-dtype fp8 снижает потребление памяти для кеша ключей и значений, --enable-expert-parallel включает параллелизм по экспертам MoE, а use_fp4_indexer_cache в attention-конфиге сжимает индексацию внимания.

Для локального запуска DeepSeek отсылает к папке inference в репозитории — там инструкции по конвертации весов и интерактивной демке. Конкретных требований к VRAM или квантизированных версий в карточке нет.

## Лицензия и коммерческое использование

Модель и репозиторий выложены под MIT License. Это значит, что можно использовать коммерчески, модифицировать и распространять без ограничений — только с указанием авторства и копией лицензии. Никаких дополнительных условий на использование нет.

## Стоит ли брать

Если вы работаете с агентными системами, code-генерацией или инструментами — V4-Flash-0731 стоит попробовать. Модель показывает результаты уровня фронтирных проприетарных решений, но с открытыми весами и MIT-лицензией. Для экспериментов с длинным контекстом (до миллиона токенов) и reasoning effort это одна из самых доступных опций. Если нужна стабильная production-модель без preview-статуса — официальный релиз V4-Pro выйдет позже, но пока V4-Flash уже обгоняет его preview-версию.

## Источники

- HF Releases: DeepSeek выпустила DeepSeek-V4-Flash-0731 — открытые веса модели
