← На главную
Новости· 31.07.2026· 3 мин чтения

DeepSeek выпустил V4-Flash-0731 — агентная модель обошла собственный V4-Pro на бенчмарках

DeepSeek выпустил официальную версию V4-Flash с усиленными агентными способностями. Модель обгоняет V4-Pro на кодогенерации и работает с контекстом в 1 млн токенов.

DeepSeek выпустил V4-Flash-0731 — агентная модель обошла собственный V4-Pro на бенчмарках
Материал подготовлен с помощью ИИ и проверен редактором

DeepSeek опубликовал финальную версию V4-Flash (билд 0731) — mixture-of-experts модель на 284 миллиарда параметров с контекстом в 1 миллион токенов. Главное изменение — дообучение на агентных задачах: модель теперь превосходит DeepSeek-V4-Pro (Preview) на публичных бенчмарках, несмотря на меньшее количество активных параметров. В команде заявляют, что V4-Flash конкурирует с проприетарными фронтирными моделями, а по соотношению производительность/цена опережает их.

Что изменилось с preview-версии

Архитектура осталась прежней — это та же MoE-модель с модулем спекулятивного декодирования (DSpark), что и в DeepSeek-V4-Flash-DSpark. Обновление коснулось только post-training: модель переобучили с акцентом на агентные сценарии, кодогенерацию и работу с инструментами.

На внутренних бенчмарках DeepSeek результаты выросли заметно: на DSBench-FullStack (тесты на полный цикл разработки) и DSBench-Hard (сложные задачи для code-агентов) модель показывает результаты, которые команда не публикует в числах, но называет «substantially enhanced». На публичных наборах V4-Flash-0731 обгоняет V4-Pro (Preview), хотя активирует меньше параметров на каждый запрос.

Важная деталь: для code-агентных задач в публичных бенчмарках модель тестировали в режиме max reasoning effort с температурой 1.0 и top_p 0.95, используя фреймворк DeepSeek Harness (пока не выложен публично).

Reasoning effort — три уровня обдумывания

В модели появился параметр reasoning_effort с тремя значениями: low, high, max. Это управляет тем, сколько времени модель тратит на размышления перед ответом. Для максимального уровня DeepSeek рекомендует выставлять лимит генерации в 384 тысячи токенов — это почти треть полного контекста в миллион.

Параметр работает через специальный формат сообщений: вместо стандартного Jinja-шаблона DeepSeek предоставляет Python-скрипты в папке encoding для кодирования OpenAI-совместимых сообщений в строки и парсинга ответов. Пример:

```python from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [ {"role": "user", "content": "1+1=?"} ]

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max") ```

Для агентных сценариев команда советует температуру 1.0 и top_p 0.95, для остальных — top_p 1.0.

Как запустить

Модель работает через vLLM с включённым спекулятивным декодированием DSpark. Это делается одним флагом --speculative-config с параметрами метода, количества спекулятивных токенов и режима сэмплирования драфта.

Пример команды для одной ноды с 4×GB300 (это карты Nvidia Blackwell с большим объёмом памяти):

``bash vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}' \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' ``

Флаг --kv-cache-dtype fp8 снижает потребление памяти для кеша ключей и значений, --enable-expert-parallel включает параллелизм по экспертам MoE, а use_fp4_indexer_cache в attention-конфиге сжимает индексацию внимания.

Для локального запуска DeepSeek отсылает к папке inference в репозитории — там инструкции по конвертации весов и интерактивной демке. Конкретных требований к VRAM или квантизированных версий в карточке нет.

Лицензия и коммерческое использование

Модель и репозиторий выложены под MIT License. Это значит, что можно использовать коммерчески, модифицировать и распространять без ограничений — только с указанием авторства и копией лицензии. Никаких дополнительных условий на использование нет.

Стоит ли брать

Если вы работаете с агентными системами, code-генерацией или инструментами — V4-Flash-0731 стоит попробовать. Модель показывает результаты уровня фронтирных проприетарных решений, но с открытыми весами и MIT-лицензией. Для экспериментов с длинным контекстом (до миллиона токенов) и reasoning effort это одна из самых доступных опций. Если нужна стабильная production-модель без preview-статуса — официальный релиз V4-Pro выйдет позже, но пока V4-Flash уже обгоняет его preview-версию.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

DeepSeek-V4-Flash-0731: агентная модель на 284B параметров обошла собственный Pro — PLai