# Qwen3.8-Flash-Next: превью архитектуры Qwen4 своими руками
Каноническая страница: https://plainews.ru/posts/qwen38-flash-next-preview-qwen4
Опубликовано: 2026-08-27T11:01:02.715Z

Как запустить Qwen3.8-Flash-Next локально: MoE-архитектура с 125 млрд параметров, но 6 активных, квантованные веса от Unsloth и тест на DGX Spark.
Alibaba выпустила Qwen3.8-Flash-Next — открытую модель, которая одновременно и рабочий инструмент, и подсказка о том, как будет устроена будущая Qwen4. Если вы следите за открытыми весами и хотите пощупать архитектуру следующего поколения до релиза, это первый шанс сделать это на своём железе.

Главная фишка модели — соотношение размера и скорости. У неё 125 миллиардов параметров, но активны из них только 6 миллиардов на каждый токен. Это классическая MoE-схема (Mixture of Experts, смесь экспертов), где модель держит в памяти много «специалистов», но для конкретного запроса включает только часть из них. Результат — модель с потенциалом крупной LLM, но с производительностью, близкой к компактной.

## Зачем это Qwen и зачем это вам

На Hugging Face карточка модели прямо помечена как "A Preview of the Qwen4 Architecture". Команда Qwen системно обновила четыре компонента: attention (механизм внимания), residual-связи, embedding-слой и оптимизацию обучения. В частности, для attention используется гибридная схема GDN + QSA — то есть разработчики уже тестируют в открытую то, что попадёт в следующее поколение моделей.

Для практика это значит две вещи. Во-первых, можно оценить, куда движется экосистема Qwen, не дожидаясь релиза Qwen4. Во-вторых, уже сейчас доступна рабочая мультимодальная модель с низкими требованиями к вычислениям за счёт малого числа активных параметров — при том что общая ёмкость модели остаётся большой.

Отдельно стоит версия Qwen3.8-Flash — это официальный продакшн-вариант на основе Next-архитектуры, но с контекстом 1M токенов по умолчанию и встроенными инструментами. Next — скорее исследовательский preview, а Flash — то, что можно ставить в прод.

## Что нужно для запуска локально

Модель на 125B параметров даже в квантованном виде — это не про ноутбук. Саймон Уиллисон тестировал её на DGX Spark, компактном ПК от Nvidia с объединённой памятью (unified memory) на 128 ГБ, где GPU и CPU делят один и тот же пул RAM. Именно такой объём памяти нужен, чтобы вместить квантованные веса модели целиком.

Для запуска использовались GGUF-квантования от Unsloth — команды, которая специализируется на ужатии открытых весов без критичной потери качества. Доступны разные уровни сжатия:

Чем меньше цифра после IQ или Q, тем агрессивнее квантование и тем сильнее модель теряет в точности, но выигрывает в размере. IQ1_S — самый жёсткий вариант из протестированных, Q2_K_XL — чуть более щадящий.

## Как скачать и запустить

Общая логика работы с квантованными GGUF-моделями от Unsloth стандартна для экосистемы llama.cpp. Сначала скачиваете нужный файл с Hugging Face:

Дальше запускаете модель через любой инференс-движок, который поддерживает GGUF — llama.cpp, LM Studio или Ollama, если модель уже добавлена в его библиотеку. На DGX Spark с 128 ГБ объединённой памяти вариант UD-Q2_K_XL на 78.9 ГБ помещается с запасом на контекст и промежуточные буфера.

Важный параметр, который стоит настроить отдельно — reasoning effort (уровень усилий на рассуждение). У Qwen3.8-Flash-Next, как и у других reasoning-моделей, есть несколько режимов. Саймон отмечает, что лучший результат он получил именно на xhigh reasoning effort с квантованием UD-Q2_K_XL — модель явно выигрывает от увеличения бюджета на размышления, если у вас есть время подождать ответ.

## Как проверить, что модель реально что-то умеет

Для быстрой проверки качества генерации у Саймона есть фирменный тест — «пеликан на велосипеде» (pelican riding a bicycle), SVG-иллюстрация, которую модель рисует кодом. Тест неформальный, но полезный: он быстро показывает, держит ли модель пространственную логику и точность в структурированном выводе, а не просто хорошо болтает.

На IQ1_S (самое агрессивное квантование) пеликан получился заметно кривее, чем на Q2_K_XL. Это ожидаемо: чем сильнее сжаты веса, тем больше деталей теряется в задачах, требующих точности, а не только беглости текста.

Если у вас нет DGX Spark, тот же принцип теста применим на любом железе, где влезает GGUF-файл — просто попросите модель нарисовать SVG чего-нибудь сложного и посмотрите на результат глазами.

## Где ломается

Главное ограничение — память. 72-79 ГБ под веса модели плюс контекст и системные накладные расходы — это отсекает почти всё потребительское железо, кроме систем с большим объёмом unified или VRAM-памяти вроде DGX Spark, Mac Studio с большим объёмом RAM или серверных GPU-кластеров.

Второе ограничение — сама природа Next-версии как preview. Это не production-релиз, а демонстрация архитектуры. Для реальных задач лучше смотреть на Qwen3.8-Flash — там уже есть контекст 1M токенов и встроенные инструменты, заточенные под прод-нагрузку.

Третье — квантование режет качество непредсказуемо в зависимости от задачи. Если вам критична точность в коде или структурированных данных, стоит тестировать минимум два уровня квантования на своих кейсах, а не полагаться на общие бенчмарки.

## Что попробовать дальше

Если есть железо с достаточным объёмом памяти — начните с UD-Q2_K_XL и xhigh reasoning effort, это комбинация с лучшим соотношением качества и размера по опыту Саймона. Дальше можно спуститься до IQ1_S, если критична скорость или объём диска, и сравнить разницу на своих задачах.

Для продакшн-сценариев имеет смысл параллельно смотреть на Qwen3.8-Flash — она построена на той же архитектуре, но с готовыми инструментами и длинным контекстом из коробки.

## FAQ

### Чем Qwen3.8-Flash-Next отличается от Qwen3.8-Flash?

Next — это исследовательский preview новой архитектуры (будущей Qwen4), а Flash — официальный продакшн-вариант на её основе, с контекстом 1M токенов и встроенными инструментами по умолчанию.

### Сколько памяти нужно для запуска локально?

Квантованные версии от Unsloth занимают от 72.5 ГБ (UD-IQ1_S) до 78.9 ГБ (UD-Q2_K_XL). Для комфортной работы с контекстом нужна система минимум со 128 ГБ памяти, например DGX Spark.

### Что значит MoE со 125B параметров, но 6B активных?

Mixture of Experts — модель хранит много «экспертных» подсетей, но на каждый токен активирует лишь часть из них (в данном случае около 6 млрд параметров). Это даёт производительность, близкую к компактной модели, при потенциале крупной.

### Что такое reasoning effort и зачем его крутить?

Это параметр, который регулирует, сколько «размышлений» модель тратит перед финальным ответом. Более высокий уровень (например, xhigh) обычно даёт более точный результат, но увеличивает время генерации.

### Стоит ли квантовать модель сильнее для экономии места?

Можно, но качество падает заметно на задачах, требующих точности — например, в генерации структурированного кода. Лучше протестировать несколько уровней квантования на собственных данных перед выбором.

## Источники

- Simon Willison: Qwen3.8-Flash-Next
