Qwen3.8-Flash-Next: превью архитектуры Qwen4 своими руками
Как запустить Qwen3.8-Flash-Next локально: MoE-архитектура с 125 млрд параметров, но 6 активных, квантованные веса от Unsloth и тест на DGX Spark.
Alibaba выпустила Qwen3.8-Flash-Next — открытую модель, которая одновременно и рабочий инструмент, и подсказка о том, как будет устроена будущая Qwen4. Если вы следите за открытыми весами и хотите пощупать архитектуру следующего поколения до релиза, это первый шанс сделать это на своём железе.
Главная фишка модели — соотношение размера и скорости. У неё 125 миллиардов параметров, но активны из них только 6 миллиардов на каждый токен. Это классическая MoE-схема (Mixture of Experts, смесь экспертов), где модель держит в памяти много «специалистов», но для конкретного запроса включает только часть из них. Результат — модель с потенциалом крупной LLM, но с производительностью, близкой к компактной.
Зачем это Qwen и зачем это вам
На Hugging Face карточка модели прямо помечена как "A Preview of the Qwen4 Architecture". Команда Qwen системно обновила четыре компонента: attention (механизм внимания), residual-связи, embedding-слой и оптимизацию обучения. В частности, для attention используется гибридная схема GDN + QSA — то есть разработчики уже тестируют в открытую то, что попадёт в следующее поколение моделей.
Для практика это значит две вещи. Во-первых, можно оценить, куда движется экосистема Qwen, не дожидаясь релиза Qwen4. Во-вторых, уже сейчас доступна рабочая мультимодальная модель с низкими требованиями к вычислениям за счёт малого числа активных параметров — при том что общая ёмкость модели остаётся большой.
Отдельно стоит версия Qwen3.8-Flash — это официальный продакшн-вариант на основе Next-архитектуры, но с контекстом 1M токенов по умолчанию и встроенными инструментами. Next — скорее исследовательский preview, а Flash — то, что можно ставить в прод.
Что нужно для запуска локально
Модель на 125B параметров даже в квантованном виде — это не про ноутбук. Саймон Уиллисон тестировал её на DGX Spark, компактном ПК от Nvidia с объединённой памятью (unified memory) на 128 ГБ, где GPU и CPU делят один и тот же пул RAM. Именно такой объём памяти нужен, чтобы вместить квантованные веса модели целиком.
Для запуска использовались GGUF-квантования от Unsloth — команды, которая специализируется на ужатии открытых весов без критичной потери качества. Доступны разные уровни сжатия:
UD-IQ1_S — 72.5 GB
UD-Q2_K_XL — 78.9 GBЧем меньше цифра после IQ или Q, тем агрессивнее квантование и тем сильнее модель теряет в точности, но выигрывает в размере. IQ1_S — самый жёсткий вариант из протестированных, Q2_K_XL — чуть более щадящий.
Как скачать и запустить
Общая логика работы с квантованными GGUF-моделями от Unsloth стандартна для экосистемы llama.cpp. Сначала скачиваете нужный файл с Hugging Face:
huggingface-cli download unsloth/Qwen3.8-Flash-Next-GGUF \
--include "UD-Q2_K_XL/*" \
--local-dir ./qwen38-flash-nextДальше запускаете модель через любой инференс-движок, который поддерживает GGUF — llama.cpp, LM Studio или Ollama, если модель уже добавлена в его библиотеку. На DGX Spark с 128 ГБ объединённой памяти вариант UD-Q2_K_XL на 78.9 ГБ помещается с запасом на контекст и промежуточные буфера.
Важный параметр, который стоит настроить отдельно — reasoning effort (уровень усилий на рассуждение). У Qwen3.8-Flash-Next, как и у других reasoning-моделей, есть несколько режимов. Саймон отмечает, что лучший результат он получил именно на xhigh reasoning effort с квантованием UD-Q2_K_XL — модель явно выигрывает от увеличения бюджета на размышления, если у вас есть время подождать ответ.
Как проверить, что модель реально что-то умеет
Для быстрой проверки качества генерации у Саймона есть фирменный тест — «пеликан на велосипеде» (pelican riding a bicycle), SVG-иллюстрация, которую модель рисует кодом. Тест неформальный, но полезный: он быстро показывает, держит ли модель пространственную логику и точность в структурированном выводе, а не просто хорошо болтает.
На IQ1_S (самое агрессивное квантование) пеликан получился заметно кривее, чем на Q2_K_XL. Это ожидаемо: чем сильнее сжаты веса, тем больше деталей теряется в задачах, требующих точности, а не только беглости текста.
Если у вас нет DGX Spark, тот же принцип теста применим на любом железе, где влезает GGUF-файл — просто попросите модель нарисовать SVG чего-нибудь сложного и посмотрите на результат глазами.
Где ломается
Главное ограничение — память. 72-79 ГБ под веса модели плюс контекст и системные накладные расходы — это отсекает почти всё потребительское железо, кроме систем с большим объёмом unified или VRAM-памяти вроде DGX Spark, Mac Studio с большим объёмом RAM или серверных GPU-кластеров.
Второе ограничение — сама природа Next-версии как preview. Это не production-релиз, а демонстрация архитектуры. Для реальных задач лучше смотреть на Qwen3.8-Flash — там уже есть контекст 1M токенов и встроенные инструменты, заточенные под прод-нагрузку.
Третье — квантование режет качество непредсказуемо в зависимости от задачи. Если вам критична точность в коде или структурированных данных, стоит тестировать минимум два уровня квантования на своих кейсах, а не полагаться на общие бенчмарки.
Что попробовать дальше
Если есть железо с достаточным объёмом памяти — начните с UD-Q2_K_XL и xhigh reasoning effort, это комбинация с лучшим соотношением качества и размера по опыту Саймона. Дальше можно спуститься до IQ1_S, если критична скорость или объём диска, и сравнить разницу на своих задачах.
Для продакшн-сценариев имеет смысл параллельно смотреть на Qwen3.8-Flash — она построена на той же архитектуре, но с готовыми инструментами и длинным контекстом из коробки.
FAQ
Чем Qwen3.8-Flash-Next отличается от Qwen3.8-Flash?
Next — это исследовательский preview новой архитектуры (будущей Qwen4), а Flash — официальный продакшн-вариант на её основе, с контекстом 1M токенов и встроенными инструментами по умолчанию.
Сколько памяти нужно для запуска локально?
Квантованные версии от Unsloth занимают от 72.5 ГБ (UD-IQ1_S) до 78.9 ГБ (UD-Q2_K_XL). Для комфортной работы с контекстом нужна система минимум со 128 ГБ памяти, например DGX Spark.
Что значит MoE со 125B параметров, но 6B активных?
Mixture of Experts — модель хранит много «экспертных» подсетей, но на каждый токен активирует лишь часть из них (в данном случае около 6 млрд параметров). Это даёт производительность, близкую к компактной модели, при потенциале крупной.
Что такое reasoning effort и зачем его крутить?
Это параметр, который регулирует, сколько «размышлений» модель тратит перед финальным ответом. Более высокий уровень (например, xhigh) обычно даёт более точный результат, но увеличивает время генерации.
Стоит ли квантовать модель сильнее для экономии места?
Можно, но качество падает заметно на задачах, требующих точности — например, в генерации структурированного кода. Лучше протестировать несколько уровней квантования на собственных данных перед выбором.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

