# 180 млрд параметров на обычном SSD: как устроена архитектура Qwen 4
Каноническая страница: https://plainews.ru/posts/qwen4-architecture-flash-next-guide
Опубликовано: 2026-08-28T11:01:15.948Z

Alibaba раскрыла архитектуру Qwen 4 через модель Qwen3.8-Flash-Next: 180B параметров, 6B активных, офлоад в RAM и 8.6x ускорение prefill на 1M токенов.
Alibaba незаметно выпустила Qwen3.8-Flash-Next — и это не просто очередная модель в линейке. Это архитектурное превью Qwen 4: то же, чем был Qwen3-Next для серии Qwen3.5–3.8. Если вы запускаете модели локально или проектируете агентские пайплайны — вот что изменится.

## Зачем вообще смотреть на эту модель сейчас

Пока Qwen 4 не вышел официально, Qwen3.8-Flash-Next уже показывает его архитектурные решения в боевых условиях. Именно так Alibaba обкатывала гибридный Gated DeltaNet + Gated Attention в Qwen3-Next — и эта конструкция потом легла в основу целой серии от Qwen3.5 до Qwen3.8.

Новая архитектура решает две давние боли локального inference: квадратичный рост KV-кэша при длинном контексте и необходимость держать все параметры в видеопамяти. Посмотрим, как именно.

## Что внутри: три независимых компонента вместо одной монолитной модели

Общий объём Qwen3.8-Flash-Next — около 180 млрд параметров, но это число нужно сразу расщепить на три части:

- **125B** — основной MoE-граф (512 маршрутизируемых экспертов, из которых на каждый токен активны 10 + 1 общий эксперт)
- **51B** — таблица N-gram эмбеддингов (PLE, Prefix Language Embeddings)
- **4B** — голова MTP (Multi-Token Prediction) для спекулятивного декодирования

Активных параметров на токен — **6B**. По вычислительной нагрузке модель сопоставима с компактными 6B-моделями, по качеству — обходит 70B+ на агентских задачах.

## 51B в оперативке: как работает N-gram офлоадинг

Самое необычное здесь — слой N-gram эмбеддингов. Это таблица на 20 млн записей: биграммы и триграммы токенов. Ключи в ней — детерминированные хеши от последней пары токенов, никаких матричных умножений.

Потому что позиции обращений известны заранее, вся таблица на 51B **не обязана находиться в VRAM**. Она читается из обычной оперативной памяти или NVMe через асинхронный префетчинг по mmap, пока GPU считает остальное в экспертах.

Практически это выглядит так: экспертный граф живёт на видеокарте, N-gram таблица — в RAM или на быстром SSD, MTP-голова работает как встроенный драфтер для speculative decoding.

Такой офлоадинг без потери точности стал возможен именно потому, что N-gram слой — это lookup-таблица, а не вычислительный граф с зависимостями по градиентам.

## Как заменили Gated Attention на Qwen Sparse Attention

В предыдущих моделях серии (например, Qwen 3.8 27B) каждый слой Gated DeltaNet дополнялся четырьмя KV-головами Gated Attention — и объём KV-кэша рос линейно с контекстом.

В Qwen3.8-Flash-Next Gated Attention заменён на **QSA (Qwen Sparse Attention)**. Принцип другой: вместо оценки каждого токена по отдельности индексирующий модуль (MQA: 4 query-головы + 1 общая K-голова, размерность 128) агрегирует историю в **микроблоки токенов**, а затем активирует внимание в рамках фиксированного бюджета — 512 блоков или 2048 токенов.

Из 48 слоёв модели:

Результат: на контексте в 1 млн токенов prefill-фаза ускоряется **в 8.6 раза** по сравнению с полным вниманием. Нативный контекст — 262K, с YaRN расширяется до 1M.

## Gated Residual и MTP: что ещё изменилось в потоке данных

**Gated Residual (GR)** разделяет единый residual-поток на 4 ветки. Поэлементный gate управляет чтением из слоя, скалярный gate — записью обратно. Одна из веток работает как «магистраль» — прямой перенос информации из ранних слоёв в глубокие без потерь. Ветки хранятся в FP8, оверхед на инференсе минимален.

**MTP-голова** — 4B-слой, обученный предсказывать несколько токенов вперёд. Он автоматически становится драфтером для speculative decoding: никаких дополнительных моделей, бесплатное ускорение генерации без потери точности.

## Цифры: Qwen3.8-Flash-Next против Qwen 3.8 27B

| Параметр | Qwen 3.8 27B | Qwen3.8-Flash-Next | |---|---|---| | Тип | Dense | MoE + N-gram | | Общие параметры | 27B | ~180B | | Активные параметры/токен | 27B | **6B** | | Attention | GDN + Gated Attention | GDN + QSA | | N-gram память | — | 51B (mmap) | | Residual | одиночный поток | 4-поточный GR | | Нативный контекст | 262K | 262K (до 1M с YaRN) |

По бенчмаркам при 6B активных параметров (в 4.5 раза меньше вычислений):

| Бенчмарк | Flash-Next | Qwen 3.8 27B | Разница | |---|---|---|---| | DeepSWE 1.1 (агентский кодинг) | 58.7 | 42.2 | **+16.5** | | SWE-bench Pro | 62.5 | 61.7 | +0.8 (паритет) | | SWE-bench Multilingual | 81.0 | 73.8 | **+7.2** | | NL2Repo-Bench | 48.1 | 42.3 | +5.8 |

## Где это ломается

**VRAM всё равно нужна для основного MoE-графа.** Офлоадинг касается только N-gram таблицы. 125B MoE с 6B активными параметрами — это несколько десятков гигабайт VRAM при квантизации до INT4/INT8. Запустить на потребительской карте не выйдет без агрессивного квантования и дополнительного CPU-офлоада.

**mmap и NVMe — не бесплатны по латентности.** Асинхронный префетчинг скрывает задержки при последовательном доступе, но если паттерн обращений к N-gram таблице непредсказуем — SSD может стать узким местом. На HDD эта архитектура, скорее всего, неприменима.

**QSA работает хорошо на длинном контексте, но хуже на коротком.** Фиксированный бюджет в 2048 токенов при запросах на 500–1000 токенов означает, что sparse-подход даёт меньше выигрыша, а overhead на индексацию микроблоков остаётся.

**Открытые веса — всё ещё не финал.** Qwen3.8-Flash-Next — архитектурное превью, не production-релиз Qwen 4. Конфигурации, квантизованные версии и интеграции в llama.cpp / vLLM могут меняться до финального релиза.

## Что попробовать дальше

Следите за HuggingFace-репозиторием Qwen — открытые веса Qwen3.8-Flash-Next должны появиться в ближайшее время. Если интересует speculative decoding с MTP-головой, стоит изучить, как аналогичный механизм реализован в DeepSeek-V3: там та же идея встроенного драфтера без отдельной модели.

---

## FAQ

### Что такое Qwen3.8-Flash-Next и зачем он вышел раньше Qwen 4?

Это архитектурное превью: Alibaba обкатывает новые решения Qwen 4 на публичной модели, как делала с Qwen3-Next для серии 3.5–3.8. Финальный Qwen 4 унаследует эту архитектуру.

### Можно ли запустить Qwen3.8-Flash-Next на потребительской видеокарте?

Не без компромиссов. Активных параметров на токен — 6B, но основной MoE-граф занимает значительно больше VRAM. Нужны квантизация (INT4/INT8) и, скорее всего, частичный офлоад на CPU. N-gram таблицу (51B) можно держать в RAM или NVMe.

### Что такое Qwen Sparse Attention и чем он отличается от обычного Attention?

Классический Attention оценивает каждый токен истории — кэш растёт линейно. QSA агрегирует историю в микроблоки и выбирает только релевантные области в рамках фиксированного бюджета (512 блоков / 2048 токенов). Это даёт 8.6x ускорение prefill на контексте в 1M токенов.

### Зачем нужна N-gram таблица на 51B, если активных параметров всего 6B?

N-gram эмбеддинги не участвуют в вычислениях как нейронная сеть — это lookup-таблица для частых биграмм и триграмм. Она хранится вне VRAM (RAM/SSD через mmap) и читается асинхронно. Фактически это дешёвая быстрая память для локальных языковых паттернов.

### Зачем нужна MTP-голова на 4B, если модель уже большая?

MTP (Multi-Token Prediction) — встроенный драфтер для speculative decoding. Он предсказывает несколько токенов вперёд, что позволяет ускорить генерацию без отдельной draft-модели и без потери качества.

## Источники

- Habr ML: Qwen 4: возбуждающая новая технология
