Qwen3.8-27B-FP8: мультимодальный монстр с FP8, который влезает на одну видеокарту
Qwen выпустила FP8-квантованную версию Qwen3.8-27B: 27 млрд параметров, понимание видео, 1M контекст и бенчмарки на уровне флагманов. Запускаем на одном GPU

13 августа команда Qwen выпустила FP8-квантованную версию своей флагманской модели Qwen3.8-27B. Это первая открытая мультимодальная модель такого масштаба, которая поддерживает видео, изображения и текст в одном фреймворке, при этом умещается в 27 ГБ видеопамяти — то есть на одной NVIDIA H100 или A100.
Что это за модель и зачем она нужна
Qwen3.8-27B — это dense-модель (не MoE) с 27 млрд параметров, обученная на тексте, изображениях и видео. В отличие от предыдущих версий Qwen, она изначально поддерживает мультимодальный ввод: может анализировать STEM-диаграммы, документы с формулами, часовые видеоролики и даже планировать действия на основе обратной связи от окружения (agentic tasks).
Ключевые особенности:
- Vision-language понимание: нативная работа с изображениями и видео без отдельных энкодеров.
- 1M контекст: из коробки поддерживает 262K токенов, при необходимости расширяется до миллиона.
- Agentic capabilities: улучшенное планирование и выполнение многошаговых задач с учётом обратной связи.
- FP8-квантизация: веса модели сжаты до 8-битного формата с минимальной потерей качества (block size 128).
Модель позиционируется как альтернатива проприетарным решениям вроде GPT-4o или Claude 3.5 Sonnet для локального развёртывания — особенно для задач, где критичны низкая задержка и контроль над данными.
Цифры: как Qwen3.8-27B сравнивается с конкурентами
В бенчмарках Qwen3.8-27B показывает результаты на уровне или выше, чем у моделей аналогичного размера. Вот ключевые показатели из карточки модели (все числа — проценты, чем выше, тем лучше):
| Категория | Бенчмарк | Qwen3.8-27B | Llama-3.1-70B | Qwen2.5-72B | DeepSeek-V2.5 | GPT-4o (2024-05) | |-----------------|------------------------|-------------|---------------|-------------|---------------|------------------| | Общие знания | MMLU (5-shot) | 78.2 | 73.0 | 63.4 | 64.0 | 51.7 | | | MMLU-Pro (5-shot) | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 | | Математика | GSM8K (8-shot) | 47.6 | 42.3 | 36.2 | 41.1 | -- | | | MATH (4-shot) | 42.2 | 36.2 | 13.3 | 14.2 | -- | | Кодинг | HumanEval (0-shot) | 79.0 | 49.3 | 59.2 | -- | 63.8 | | Агенты | AgentBench (OS) | 70.7 | 61.0 | 65.1 | -- | 68.2 | | | AgentBench (Web) | 33.4 | 21.8 | 27.6 | -- | -- |
Из таблицы видно, что Qwen3.8-27B обходит Llama-3.1-70B в кодинге (79.0 vs 49.3) и математике (42.2 vs 36.2), а также показывает лучшие результаты в агентских задачах. При этом модель в 2.5 раза меньше по параметрам, чем Llama-3.1-70B.
Лицензия: что можно, а что нельзя
Модель распространяется под лицензией Qwen Research License. Основные ограничения:
- Разрешено: коммерческое использование, модификация, распространение.
- Запрещено: использовать для разработки других моделей, которые будут конкурировать с Qwen (пункт 2.3).
- Обязательно: указывать авторство и сохранять лицензию при распространении производных работ.
Это стандартная для Qwen лицензия, которая позволяет использовать модель в продакшене, но ограничивает создание прямых конкурентов. Для большинства пользователей ограничения не критичны.
Как запустить Qwen3.8-27B-FP8 у себя
Требования к железу
- Минимум: 1 GPU с 28 ГБ VRAM (например, NVIDIA RTX 4090 с 24 ГБ не подойдёт).
- Рекомендуется: NVIDIA H100 (80 ГБ) или A100 (80 ГБ) для работы с длинным контекстом.
- CPU: 32+ ГБ RAM.
- Диск: ~30 ГБ свободного места для весов и кэша.
Модель оптимизирована для FP8-инференса, поэтому даже на одной видеокарте работает с приемлемой скоростью. Для мультимодальных задач (видео, изображения) потребуется дополнительная память для буферов.
Команды запуска
Через vLLM (рекомендуется для продакшена)
``bash pip install vllm python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B-FP8 \ --dtype auto \ --max-model-len 262144 \ --gpu-memory-utilization 0.95 \ --tensor-parallel-size 1 ``
Через transformers (для экспериментов)
```bash pip install transformers torch from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen3.8-27B-FP8", device_map="auto", torch_dtype="auto" ) tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3.8-27B-FP8")
inputs = tokenizer("Опиши, что происходит на этом изображении:", return_tensors="pt").to("cuda") image = ... # загрузите PIL.Image outputs = model.generate(**inputs, images=image) print(tokenizer.decode(outputs[0])) ```
Через SGLang (для высокопроизводительной инференса)
``bash pip install sglang python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B-FP8 \ --tokenizer-path Qwen/Qwen3.8-27B-FP8 \ --chat-template qwen \ --dtype auto ``
Через Ollama (для локального использования)
Пока модель не добавлена в официальный репозиторий Ollama, но можно запустить через кастомный манифест: ``bash ollama create qwen3.8-27b-fp8 -f Modelfile ` Где Modelfile содержит: ` FROM ./qwen3.8-27b-fp8 TEMPLATE "{{ .Prompt }}" PARAMETER num_ctx 262144 ``
Где это ломается
- Видеообработка: Для анализа часовых видео потребуется GPU с 80+ ГБ VRAM. На H100 с 80 ГБ модель справляется, но на A100 может не хватить памяти при длинном контексте.
- FP8-поддержка: Не все фреймворки корректно работают с FP8-квантизацией. Например, в
transformersмогут быть баги с загрузкой весов — лучше использовать vLLM или SGLang. - Мультимодальный ввод: В карточке нет примеров для видео, только для изображений. Для работы с видео придётся самостоятельно интегрировать энкодер (например, через
decordилиpytorchvideo). - Длинный контекст: При контексте >200K токенов скорость инференса заметно падает даже на H100. Для продакшен-задач с 1M контекстом лучше использовать облачную версию от Qwen Cloud.
Стоит ли брать
Qwen3.8-27B-FP8 — это лучший выбор для локального развёртывания мультимодальной модели в классе до 30 млрд параметров. Она подойдёт:
- Разработчикам, которым нужна модель с пониманием видео и изображений без облачных зависимостей.
- Компаниям, работающим с документами (STEM, формулы, диаграммы) или видеоконтентом.
- Исследователям, изучающим агентские системы или длинный контекст.
Не стоит брать, если:
- У вас нет GPU с 28+ ГБ VRAM.
- Нужна максимальная скорость инференса на коротких запросах (для этого лучше подойдут модели с INT4-квантизацией).
- Требуется полная свобода лицензии (например, для обучения конкурирующих моделей).
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


