DeepSeek выпустил V4-Flash-0731 — агентная модель обошла собственный V4-Pro на бенчмарках
DeepSeek выпустил официальную версию V4-Flash с усиленными агентными способностями. Модель обгоняет V4-Pro на кодогенерации и работает с контекстом в 1 млн токенов.

DeepSeek опубликовал финальную версию V4-Flash (билд 0731) — mixture-of-experts модель на 284 миллиарда параметров с контекстом в 1 миллион токенов. Главное изменение — дообучение на агентных задачах: модель теперь превосходит DeepSeek-V4-Pro (Preview) на публичных бенчмарках, несмотря на меньшее количество активных параметров. В команде заявляют, что V4-Flash конкурирует с проприетарными фронтирными моделями, а по соотношению производительность/цена опережает их.
Что изменилось с preview-версии
Архитектура осталась прежней — это та же MoE-модель с модулем спекулятивного декодирования (DSpark), что и в DeepSeek-V4-Flash-DSpark. Обновление коснулось только post-training: модель переобучили с акцентом на агентные сценарии, кодогенерацию и работу с инструментами.
На внутренних бенчмарках DeepSeek результаты выросли заметно: на DSBench-FullStack (тесты на полный цикл разработки) и DSBench-Hard (сложные задачи для code-агентов) модель показывает результаты, которые команда не публикует в числах, но называет «substantially enhanced». На публичных наборах V4-Flash-0731 обгоняет V4-Pro (Preview), хотя активирует меньше параметров на каждый запрос.
Важная деталь: для code-агентных задач в публичных бенчмарках модель тестировали в режиме max reasoning effort с температурой 1.0 и top_p 0.95, используя фреймворк DeepSeek Harness (пока не выложен публично).
Reasoning effort — три уровня обдумывания
В модели появился параметр reasoning_effort с тремя значениями: low, high, max. Это управляет тем, сколько времени модель тратит на размышления перед ответом. Для максимального уровня DeepSeek рекомендует выставлять лимит генерации в 384 тысячи токенов — это почти треть полного контекста в миллион.
Параметр работает через специальный формат сообщений: вместо стандартного Jinja-шаблона DeepSeek предоставляет Python-скрипты в папке encoding для кодирования OpenAI-совместимых сообщений в строки и парсинга ответов. Пример:
```python from encoding_dsv4 import encode_messages, parse_message_from_completion_text
messages = [ {"role": "user", "content": "1+1=?"} ]
prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max") ```
Для агентных сценариев команда советует температуру 1.0 и top_p 0.95, для остальных — top_p 1.0.
Как запустить
Модель работает через vLLM с включённым спекулятивным декодированием DSpark. Это делается одним флагом --speculative-config с параметрами метода, количества спекулятивных токенов и режима сэмплирования драфта.
Пример команды для одной ноды с 4×GB300 (это карты Nvidia Blackwell с большим объёмом памяти):
``bash vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}' \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ``
Флаг --kv-cache-dtype fp8 снижает потребление памяти для кеша ключей и значений, --enable-expert-parallel включает параллелизм по экспертам MoE, а use_fp4_indexer_cache в attention-конфиге сжимает индексацию внимания.
Для локального запуска DeepSeek отсылает к папке inference в репозитории — там инструкции по конвертации весов и интерактивной демке. Конкретных требований к VRAM или квантизированных версий в карточке нет.
Лицензия и коммерческое использование
Модель и репозиторий выложены под MIT License. Это значит, что можно использовать коммерчески, модифицировать и распространять без ограничений — только с указанием авторства и копией лицензии. Никаких дополнительных условий на использование нет.
Стоит ли брать
Если вы работаете с агентными системами, code-генерацией или инструментами — V4-Flash-0731 стоит попробовать. Модель показывает результаты уровня фронтирных проприетарных решений, но с открытыми весами и MIT-лицензией. Для экспериментов с длинным контекстом (до миллиона токенов) и reasoning effort это одна из самых доступных опций. Если нужна стабильная production-модель без preview-статуса — официальный релиз V4-Pro выйдет позже, но пока V4-Flash уже обгоняет его preview-версию.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


