180 млрд параметров на обычном SSD: как устроена архитектура Qwen 4
Alibaba раскрыла архитектуру Qwen 4 через модель Qwen3.8-Flash-Next: 180B параметров, 6B активных, офлоад в RAM и 8.6x ускорение prefill на 1M токенов.

Alibaba незаметно выпустила Qwen3.8-Flash-Next — и это не просто очередная модель в линейке. Это архитектурное превью Qwen 4: то же, чем был Qwen3-Next для серии Qwen3.5–3.8. Если вы запускаете модели локально или проектируете агентские пайплайны — вот что изменится.
Зачем вообще смотреть на эту модель сейчас
Пока Qwen 4 не вышел официально, Qwen3.8-Flash-Next уже показывает его архитектурные решения в боевых условиях. Именно так Alibaba обкатывала гибридный Gated DeltaNet + Gated Attention в Qwen3-Next — и эта конструкция потом легла в основу целой серии от Qwen3.5 до Qwen3.8.
Новая архитектура решает две давние боли локального inference: квадратичный рост KV-кэша при длинном контексте и необходимость держать все параметры в видеопамяти. Посмотрим, как именно.
Что внутри: три независимых компонента вместо одной монолитной модели
Общий объём Qwen3.8-Flash-Next — около 180 млрд параметров, но это число нужно сразу расщепить на три части:
- 125B — основной MoE-граф (512 маршрутизируемых экспертов, из которых на каждый токен активны 10 + 1 общий эксперт)
- 51B — таблица N-gram эмбеддингов (PLE, Prefix Language Embeddings)
- 4B — голова MTP (Multi-Token Prediction) для спекулятивного декодирования
Активных параметров на токен — 6B. По вычислительной нагрузке модель сопоставима с компактными 6B-моделями, по качеству — обходит 70B+ на агентских задачах.
51B в оперативке: как работает N-gram офлоадинг
Самое необычное здесь — слой N-gram эмбеддингов. Это таблица на 20 млн записей: биграммы и триграммы токенов. Ключи в ней — детерминированные хеши от последней пары токенов, никаких матричных умножений.
Потому что позиции обращений известны заранее, вся таблица на 51B не обязана находиться в VRAM. Она читается из обычной оперативной памяти или NVMe через асинхронный префетчинг по mmap, пока GPU считает остальное в экспертах.
Практически это выглядит так: экспертный граф живёт на видеокарте, N-gram таблица — в RAM или на быстром SSD, MTP-голова работает как встроенный драфтер для speculative decoding.
# Псевдоструктура размещения компонентов при локальном запуске
GPU VRAM: MoE experts (125B, активны ~6B на токен)
System RAM: N-gram PLE table (51B, mmap-доступ)
GPU VRAM: MTP head (4B, драфтер для spec decoding)Такой офлоадинг без потери точности стал возможен именно потому, что N-gram слой — это lookup-таблица, а не вычислительный граф с зависимостями по градиентам.
Как заменили Gated Attention на Qwen Sparse Attention
В предыдущих моделях серии (например, Qwen 3.8 27B) каждый слой Gated DeltaNet дополнялся четырьмя KV-головами Gated Attention — и объём KV-кэша рос линейно с контекстом.
В Qwen3.8-Flash-Next Gated Attention заменён на QSA (Qwen Sparse Attention). Принцип другой: вместо оценки каждого токена по отдельности индексирующий модуль (MQA: 4 query-головы + 1 общая K-голова, размерность 128) агрегирует историю в микроблоки токенов, а затем активирует внимание в рамках фиксированного бюджета — 512 блоков или 2048 токенов.
Из 48 слоёв модели:
36 слоёв (3 из 4) — Gated DeltaNet (GDN)
→ линейная рекуррентность, сжимает историю в состояние фиксированного размера
→ KV-кэш не растёт
12 слоёв (1 из 4) — Qwen Sparse Attention (QSA)
→ точечный поиск по реальной истории
→ фиксированный бюджет вниманияРезультат: на контексте в 1 млн токенов prefill-фаза ускоряется в 8.6 раза по сравнению с полным вниманием. Нативный контекст — 262K, с YaRN расширяется до 1M.
Gated Residual и MTP: что ещё изменилось в потоке данных
Gated Residual (GR) разделяет единый residual-поток на 4 ветки. Поэлементный gate управляет чтением из слоя, скалярный gate — записью обратно. Одна из веток работает как «магистраль» — прямой перенос информации из ранних слоёв в глубокие без потерь. Ветки хранятся в FP8, оверхед на инференсе минимален.
MTP-голова — 4B-слой, обученный предсказывать несколько токенов вперёд. Он автоматически становится драфтером для speculative decoding: никаких дополнительных моделей, бесплатное ускорение генерации без потери точности.
Цифры: Qwen3.8-Flash-Next против Qwen 3.8 27B
| Параметр | Qwen 3.8 27B | Qwen3.8-Flash-Next | |---|---|---| | Тип | Dense | MoE + N-gram | | Общие параметры | 27B | ~180B | | Активные параметры/токен | 27B | 6B | | Attention | GDN + Gated Attention | GDN + QSA | | N-gram память | — | 51B (mmap) | | Residual | одиночный поток | 4-поточный GR | | Нативный контекст | 262K | 262K (до 1M с YaRN) |
По бенчмаркам при 6B активных параметров (в 4.5 раза меньше вычислений):
| Бенчмарк | Flash-Next | Qwen 3.8 27B | Разница | |---|---|---|---| | DeepSWE 1.1 (агентский кодинг) | 58.7 | 42.2 | +16.5 | | SWE-bench Pro | 62.5 | 61.7 | +0.8 (паритет) | | SWE-bench Multilingual | 81.0 | 73.8 | +7.2 | | NL2Repo-Bench | 48.1 | 42.3 | +5.8 |
Где это ломается
VRAM всё равно нужна для основного MoE-графа. Офлоадинг касается только N-gram таблицы. 125B MoE с 6B активными параметрами — это несколько десятков гигабайт VRAM при квантизации до INT4/INT8. Запустить на потребительской карте не выйдет без агрессивного квантования и дополнительного CPU-офлоада.
mmap и NVMe — не бесплатны по латентности. Асинхронный префетчинг скрывает задержки при последовательном доступе, но если паттерн обращений к N-gram таблице непредсказуем — SSD может стать узким местом. На HDD эта архитектура, скорее всего, неприменима.
QSA работает хорошо на длинном контексте, но хуже на коротком. Фиксированный бюджет в 2048 токенов при запросах на 500–1000 токенов означает, что sparse-подход даёт меньше выигрыша, а overhead на индексацию микроблоков остаётся.
Открытые веса — всё ещё не финал. Qwen3.8-Flash-Next — архитектурное превью, не production-релиз Qwen 4. Конфигурации, квантизованные версии и интеграции в llama.cpp / vLLM могут меняться до финального релиза.
Что попробовать дальше
Следите за HuggingFace-репозиторием Qwen — открытые веса Qwen3.8-Flash-Next должны появиться в ближайшее время. Если интересует speculative decoding с MTP-головой, стоит изучить, как аналогичный механизм реализован в DeepSeek-V3: там та же идея встроенного драфтера без отдельной модели.
FAQ
Что такое Qwen3.8-Flash-Next и зачем он вышел раньше Qwen 4?
Это архитектурное превью: Alibaba обкатывает новые решения Qwen 4 на публичной модели, как делала с Qwen3-Next для серии 3.5–3.8. Финальный Qwen 4 унаследует эту архитектуру.
Можно ли запустить Qwen3.8-Flash-Next на потребительской видеокарте?
Не без компромиссов. Активных параметров на токен — 6B, но основной MoE-граф занимает значительно больше VRAM. Нужны квантизация (INT4/INT8) и, скорее всего, частичный офлоад на CPU. N-gram таблицу (51B) можно держать в RAM или NVMe.
Что такое Qwen Sparse Attention и чем он отличается от обычного Attention?
Классический Attention оценивает каждый токен истории — кэш растёт линейно. QSA агрегирует историю в микроблоки и выбирает только релевантные области в рамках фиксированного бюджета (512 блоков / 2048 токенов). Это даёт 8.6x ускорение prefill на контексте в 1M токенов.
Зачем нужна N-gram таблица на 51B, если активных параметров всего 6B?
N-gram эмбеддинги не участвуют в вычислениях как нейронная сеть — это lookup-таблица для частых биграмм и триграмм. Она хранится вне VRAM (RAM/SSD через mmap) и читается асинхронно. Фактически это дешёвая быстрая память для локальных языковых паттернов.
Зачем нужна MTP-голова на 4B, если модель уже большая?
MTP (Multi-Token Prediction) — встроенный драфтер для speculative decoding. Он предсказывает несколько токенов вперёд, что позволяет ускорить генерацию без отдельной draft-модели и без потери качества.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

