# Qwen3.8-27B-FP8: мультимодальный монстр с FP8, который влезает на одну видеокарту
Каноническая страница: https://plainews.ru/posts/qwen3-8-27b-fp8-obzor
Опубликовано: 2026-08-14T18:56:31.870Z

Qwen выпустила FP8-квантованную версию Qwen3.8-27B: 27 млрд параметров, понимание видео, 1M контекст и бенчмарки на уровне флагманов. Запускаем на одном GPU
13 августа команда Qwen выпустила FP8-квантованную версию своей флагманской модели Qwen3.8-27B. Это первая открытая мультимодальная модель такого масштаба, которая поддерживает видео, изображения и текст в одном фреймворке, при этом умещается в 27 ГБ видеопамяти — то есть на одной NVIDIA H100 или A100.

## Что это за модель и зачем она нужна

Qwen3.8-27B — это dense-модель (не MoE) с 27 млрд параметров, обученная на тексте, изображениях и видео. В отличие от предыдущих версий Qwen, она изначально поддерживает мультимодальный ввод: может анализировать STEM-диаграммы, документы с формулами, часовые видеоролики и даже планировать действия на основе обратной связи от окружения (agentic tasks).

Ключевые особенности:

- **Vision-language понимание**: нативная работа с изображениями и видео без отдельных энкодеров.
- **1M контекст**: из коробки поддерживает 262K токенов, при необходимости расширяется до миллиона.
- **Agentic capabilities**: улучшенное планирование и выполнение многошаговых задач с учётом обратной связи.
- **FP8-квантизация**: веса модели сжаты до 8-битного формата с минимальной потерей качества (block size 128).

Модель позиционируется как альтернатива проприетарным решениям вроде GPT-4o или Claude 3.5 Sonnet для локального развёртывания — особенно для задач, где критичны низкая задержка и контроль над данными.

## Цифры: как Qwen3.8-27B сравнивается с конкурентами

В бенчмарках Qwen3.8-27B показывает результаты на уровне или выше, чем у моделей аналогичного размера. Вот ключевые показатели из карточки модели (все числа — проценты, чем выше, тем лучше):

| Категория       | Бенчмарк               | Qwen3.8-27B | Llama-3.1-70B | Qwen2.5-72B | DeepSeek-V2.5 | GPT-4o (2024-05) | |-----------------|------------------------|-------------|---------------|-------------|---------------|------------------| | **Общие знания** | MMLU (5-shot)          | 78.2        | 73.0          | 63.4        | 64.0          | 51.7             | |                 | MMLU-Pro (5-shot)      | 61.7        | 53.5          | 57.6        | 51.2          | 53.4             | | **Математика**   | GSM8K (8-shot)         | 47.6        | 42.3          | 36.2        | 41.1          | --               | |                 | MATH (4-shot)          | 42.2        | 36.2          | 13.3        | 14.2          | --               | | **Кодинг**       | HumanEval (0-shot)     | 79.0        | 49.3          | 59.2        | --            | 63.8             | | **Агенты**       | AgentBench (OS)        | 70.7        | 61.0          | 65.1        | --            | 68.2             | |                 | AgentBench (Web)       | 33.4        | 21.8          | 27.6        | --            | --               |

Из таблицы видно, что Qwen3.8-27B обходит Llama-3.1-70B в кодинге (79.0 vs 49.3) и математике (42.2 vs 36.2), а также показывает лучшие результаты в агентских задачах. При этом модель в 2.5 раза меньше по параметрам, чем Llama-3.1-70B.

## Лицензия: что можно, а что нельзя

Модель распространяется под лицензией **Qwen Research License**. Основные ограничения:

- **Разрешено**: коммерческое использование, модификация, распространение.
- **Запрещено**: использовать для разработки других моделей, которые будут конкурировать с Qwen (пункт 2.3).
- **Обязательно**: указывать авторство и сохранять лицензию при распространении производных работ.

Это стандартная для Qwen лицензия, которая позволяет использовать модель в продакшене, но ограничивает создание прямых конкурентов. Для большинства пользователей ограничения не критичны.

## Как запустить Qwen3.8-27B-FP8 у себя

### Требования к железу

- **Минимум**: 1 GPU с 28 ГБ VRAM (например, NVIDIA RTX 4090 с 24 ГБ не подойдёт).
- **Рекомендуется**: NVIDIA H100 (80 ГБ) или A100 (80 ГБ) для работы с длинным контекстом.
- **CPU**: 32+ ГБ RAM.
- **Диск**: ~30 ГБ свободного места для весов и кэша.

Модель оптимизирована для FP8-инференса, поэтому даже на одной видеокарте работает с приемлемой скоростью. Для мультимодальных задач (видео, изображения) потребуется дополнительная память для буферов.

### Команды запуска

### Через vLLM (рекомендуется для продакшена)

``bash pip install vllm python -m vllm.entrypoints.openai.api_server \     --model Qwen/Qwen3.8-27B-FP8 \     --dtype auto \     --max-model-len 262144 \     --gpu-memory-utilization 0.95 \     --tensor-parallel-size 1 ``

### Через transformers (для экспериментов)

```bash pip install transformers torch from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(     "Qwen/Qwen3.8-27B-FP8",     device_map="auto",     torch_dtype="auto" ) tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3.8-27B-FP8")

inputs = tokenizer("Опиши, что происходит на этом изображении:", return_tensors="pt").to("cuda") image = ...  # загрузите PIL.Image outputs = model.generate(**inputs, images=image) print(tokenizer.decode(outputs[0])) ```

### Через SGLang (для высокопроизводительной инференса)

``bash pip install sglang python -m sglang.launch_server \     --model-path Qwen/Qwen3.8-27B-FP8 \     --tokenizer-path Qwen/Qwen3.8-27B-FP8 \     --chat-template qwen \     --dtype auto ``

### Через Ollama (для локального использования)

Пока модель не добавлена в официальный репозиторий Ollama, но можно запустить через кастомный манифест: ``bash ollama create qwen3.8-27b-fp8 -f Modelfile ` Где Modelfile содержит: ` FROM ./qwen3.8-27b-fp8 TEMPLATE "{{ .Prompt }}" PARAMETER num_ctx 262144 ``

## Где это ломается

1. **Видеообработка**: Для анализа часовых видео потребуется GPU с 80+ ГБ VRAM. На H100 с 80 ГБ модель справляется, но на A100 может не хватить памяти при длинном контексте.
2. **FP8-поддержка**: Не все фреймворки корректно работают с FP8-квантизацией. Например, в transformers могут быть баги с загрузкой весов — лучше использовать vLLM или SGLang.
3. **Мультимодальный ввод**: В карточке нет примеров для видео, только для изображений. Для работы с видео придётся самостоятельно интегрировать энкодер (например, через decord или pytorchvideo).
4. **Длинный контекст**: При контексте >200K токенов скорость инференса заметно падает даже на H100. Для продакшен-задач с 1M контекстом лучше использовать облачную версию от Qwen Cloud.

## Стоит ли брать

Qwen3.8-27B-FP8 — это лучший выбор для локального развёртывания мультимодальной модели в классе до 30 млрд параметров. Она подойдёт:

- Разработчикам, которым нужна модель с пониманием видео и изображений без облачных зависимостей.
- Компаниям, работающим с документами (STEM, формулы, диаграммы) или видеоконтентом.
- Исследователям, изучающим агентские системы или длинный контекст.

Не стоит брать, если:

- У вас нет GPU с 28+ ГБ VRAM.
- Нужна максимальная скорость инференса на коротких запросах (для этого лучше подойдут модели с INT4-квантизацией).
- Требуется полная свобода лицензии (например, для обучения конкурирующих моделей).

## Источники

- HF Releases: Qwen выпустила Qwen3.8-27B-FP8 — открытые веса модели
