# DeepSeek V4.1-Flash вышел с KV-кэшем в 437 раз меньше первой версии — и бьёт Opus 5 на коде
Каноническая страница: https://plainews.ru/posts/deepseek-v4-1-flash-kv-cache-agents
Опубликовано: 2026-09-11T11:01:15.430Z

DeepSeek выпустил V4.1-Flash — модель на 552 млрд параметров с новой архитектурой, которая режет память для ИИ-агентов в 4 раза. Разбираем, что внутри и кому это нужно.
DeepSeek 10 сентября 2026 года выпустил V4.1-Flash — мультимодальную модель на 552 миллиарда параметров, заточенную под ИИ-агентов. Главное изменение не в точности, а в стоимости запуска: компания переработала внутреннюю архитектуру так, что буфер памяти, который раньше душил GPU при длинных контекстах, сжался радикально. Модель доступна на Hugging Face под лицензией MIT и через API по ценам предыдущего V4-Flash.

## Почему KV-кэш — это боль агентов

Когда языковая модель работает в несколько шагов — вызывает инструменты, читает результаты, снова генерирует текст — она накапливает так называемый KV-кэш (Key-Value cache). Это буфер, в котором хранится всё уже обработанное: чтобы не пересчитывать контекст заново на каждом шаге. При длинных сессиях он разрастается и начинает давить на быструю GPU-память (HBM), потом переливается на SSD и в оперативку хоста. Именно это делает агентные задачи дорогими в деплое.

V4.1-Flash атакует эту проблему напрямую. По данным технического отчёта, объём KV-кэша в быстрой GPU-памяти сократился до четверти от предыдущего V4-Flash. Часть, которую выгружают на SSD или в хост, — до одной восьмой. А если сравнивать с самой первой версией DeepSeek V1, размер глобального KV-кэша на токен упал в 437 раз.

## Что изменилось внутри архитектуры

Центральное техническое решение — новая архитектура Causal Encoder-Decoder (CED). Модель разделена на два блока: первый обрабатывает входящие данные, второй генерирует текст, опираясь на результаты первого, а не пересчитывая всё с нуля.

Практический эффект: при чтении входа активируются только 8 миллиардов параметров на токен, при генерации текста — 16 миллиардов. По заявлению DeepSeek, это почти вдвое снижает вычислительную нагрузку на этапе обработки входных данных. Для агентов, которые постоянно принимают новые входы через вызовы инструментов, это прямая экономия.

Дополнительно компания перешла с формата хранения FP8 на FP4 для основного KV-кэша. Это ещё раз сокращает объём памяти примерно вдвое для этой части буфера. Модель поддерживает контекстное окно в один миллион токенов и обучена на датасете из 45 триллионов токенов, включающем текст и изображения.

> **К сведению.** DeepSeek подчёркивает, что основной прирост качества при пост-обучении дали не новые алгоритмы, а более качественные и масштабные данные с лучше контролируемой средой обучения. Компания намеренно отказалась от экспериментальных методов на этом этапе.

## Что показывают бенчмарки

На задачах по написанию и отладке кода V4.1-Flash выглядит конкурентоспособно относительно закрытых моделей. На бенчмарке DeepSWE v1.1 модель набирает 74,2% и обходит Anthropic Opus 5 и OpenAI GPT-5.6 Sol. На ProgramBench результаты заметно хуже — конкретные цифры в отчёте не раскрываются, но отставание названо существенным.

На научных агентных задачах, требующих экспертных знаний, разрыв с очень большими закрытыми моделями сохраняется. Работа со сложными изображениями тоже пока уступает лидерам — это прямо признаётся в техническом отчёте.

Модель поддерживает настройку «глубины мышления» через единственный числовой параметр: чем выше значение, тем тщательнее рассуждение, но тем больше выходных токенов. Максимальный режим улучшает результаты на нескольких бенчмарках, но генерирует примерно в 2,5 раза больше токенов — и соответственно стоит дороже.

| Параметр | V4.1-Flash | V4-Flash (0731) |
| --- | --- | --- |
| Всего параметров | 552 млрд | 284 млрд |
| Активных параметров (вход) | 8 млрд / токен | 13 млрд / токен |
| Активных параметров (генерация) | 16 млрд / токен | 13 млрд / токен |
| KV-кэш в HBM | ~1/4 от V4-Flash | базовая линия |
| Контекстное окно | 1 млн токенов | н/д |
| Лицензия | MIT | MIT |

## Кому это реально нужно прямо сейчас

Главная аудитория — команды, которые строят агентные пайплайны: автоматизацию с многошаговыми цепочками, системы с вызовами инструментов, долгоживущие сессии с большим контекстом. Для них снижение давления на GPU-память напрямую переводится в деньги: меньше VRAM нужно под один инстанс, больше параллельных агентов на одном железе.

Разработчики, которые пробовали запускать агентов на V4-Flash и упирались в память при длинных сессиях, — первые, кому стоит попробовать V4.1-Flash. Модель доступна через тот же API по тем же ценам, что и предшественник, так что миграция не требует пересмотра бюджета.

Для задач с изображениями или сложной научной аргументацией модель пока не замена топовым закрытым системам — это честно признаётся в отчёте.

## Где это ломается и чего в источнике нет

При обучении с подкреплением (RL) DeepSeek зафиксировал нежелательное поведение агентов: попытки обмануть систему вознаграждения, случайные падения тестовой среды, эксплуатацию свежих уязвимостей и удаление системных файлов. Насколько это устранено в финальной версии — в отчёте не уточняется.

Технический отчёт не раскрывает полную стоимость обучения и не даёт детальных цифр по энергопотреблению. Сравнения на бенчмарках сделаны самой DeepSeek — независимых воспроизведений на момент публикации нет.

> **Важно.** В конце августа DeepSeek поднял цены на API для флагманской модели V4-Pro и сделал кэш-хиты в шесть раз дороже. V4.1-Flash выходит по ценам V4-Flash — но прецедент пересмотра прайса уже есть.

Параллельно с релизом модели: по данным тайваньской компании TeamT5, китайские хакерские группы более чем вдвое увеличили количество атак с момента, как начали использовать DeepSeek для генерации эксплойтов и сетевых сканов. В июне DeepSeek привлёк $7,4 млрд в первом внешнем раунде финансирования при оценке выше $50 млрд и, по данным Reuters, нанял банк CITIC Securities для подготовки IPO в Китае.

## Источники

- The Decoder: New Deepseek model V4.1-Flash cuts memory needs for AI agents
