# Qwen 3.8 27B: запускаем на одной видеокарте за 10 минут — даже на RTX 3090
Каноническая страница: https://plainews.ru/posts/qwen-3-8-27b-lokalnyj-zapusk-rtx
Опубликовано: 2026-08-16T07:00:55.863Z

Новая модель Qwen 3.8 27B работает быстрее Opus, понимает видео и запускается на одной видеокарте. Пошаговая инструкция для разработчиков: кванты, конфиги, скорость генерации и подводные камни
Новая модель от команды Qwen умеет анализировать видео, работает быстрее Opus 4.6 и запускается на одной видеокарте с 24 ГБ VRAM. В этом гайде — пошаговая инструкция для разработчиков: какие кванты выбрать, как настроить контекст до 1 млн токенов и почему на RTX 3090 придётся пожертвовать скоростью.

## Зачем это нужно: три причины попробовать Qwen 3.8 27B прямо сейчас

Модель весит 27 млрд параметров, но благодаря оптимизациям работает на одной видеокарте — даже на RTX 3090 с 24 ГБ VRAM. Вот что она умеет из коробки:

1. **Мультимодальность**: понимает изображения и видео (по бенчмаркам обгоняет Opus 4.6).
2. **Длинный контекст**: изначально поддерживает 262K токенов, с YARN можно растянуть до 1 млн.
3. **Скорость**: на RTX 5090 выдаёт 120 токенов в секунду в кванте Q5_K_XL.

Если вы тестируете локальные LLM для чат-ботов, анализа документов или генерации кода — Qwen 3.8 27B может стать заменой платным API или медленным моделям вроде Llama 3.1 70B.

## Шаг 1: выбираем квант под свою видеокарту

Модель доступна в формате GGUF на Hugging Face. Ключевой момент — выбор кванта зависит от объёма VRAM:

| Видеокарта       | Рекомендуемый квант               | Контекст (токенов) | Скорость (т/с) | |------------------|-----------------------------------|--------------------|----------------| | RTX 5090 (32 ГБ) | UD-Q6_K_XL или UD-Q5_K_XL     | 48K / 125K         | 100 / 120      | | RTX 4090 (24 ГБ) | UD-Q5_K_XL или IQ4_KS_KT*     | 125K / 262K        | 80-100         | | RTX 3090 (24 ГБ) | IQ4_KS_KT (специальный квант)   | 64K                | 60-80          |

*Квант IQ4_KS_KT оптимизирован для карт с 16-24 ГБ VRAM: ссылка на Hugging Face.

**Важно**: Если VRAM не хватает, llama.cpp автоматически выгружает слои в оперативную память, но скорость упадёт в 2-3 раза.

## Шаг 2: запускаем модель через llama.cpp

Установите llama.cpp с поддержкой CUDA. Для RTX 5090 с квантом UD-Q5_K_XL команда запуска выглядит так:

``bash llama-server \   -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL \   --host 0.0.0.0 --port 8080 \   --fit off --gpu-layers all --gpu-layers-draft all \   --ctx-size 125000 \   --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \   --spec-type draft-mtp ``

Параметры для настройки:

- --ctx-size: задаёт размер контекста (максимум 262K без YARN).
- --spec-type draft-mtp: включает спекулятивное предсказание для ускорения генерации.
- --gpu-layers all: загружает все слои на GPU (если VRAM хватает).

## Шаг 3: запуск в Docker (для ленивых)

Если не хотите собирать llama.cpp вручную, используйте готовый образ с CUDA:

```yaml services:   llama:     image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423     container_name: llama     devices:

ports:

environment:

volumes:

entrypoint: ["./llama-server"]     command: >       --host 0.0.0.0 --port 8080       --ctx-size 125000       --fit off --gpu-layers all --gpu-layers-draft all       -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL       --spec-type draft-mtp       --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 ```

- "nvidia.com/gpu=all"
- "8080:8080"
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
- ~/.cache:/root/.cache

Запустите командой: ``bash docker compose up -d ``

## Шаг 4: тестируем мультимодальность и длинный контекст

Qwen 3.8 27B поддерживает анализ изображений и видео "из коробки". Пример запроса через API:

```python import requests

response = requests.post(     "http://localhost:8080/completion",     json={         "prompt": "Опиши, что происходит на этом видео: [base64-encoded-video]",         "n_predict": 200,         "temperature": 0.7     } ) print(response.json()["content"]) ```

**Для длинного контекста** (до 1 млн токенов) используйте YARN: ``bash --rope-scaling yarn --rope-factor 4.0 `` Но учтите: на RTX 3090 с 24 ГБ VRAM контекст больше 64K работать не будет.

## Где ломается: подводные камни

1. **VRAM vs скорость**: На RTX 3090 с квантом IQ4_KS_KT скорость падает до 60 т/с, а контекст ограничен 64K.
2. **Спекулятивное предсказание**: Параметр --spec-type draft-mtp ускоряет генерацию, но может снижать качество ответов на сложных задачах.
3. **Мультимодальность**: Видео обрабатываются медленнее изображений — на RTX 5090 анализ 10-секундного ролика занимает 15-20 секунд.
4. **API недоступен**: Пока модель не появилась в официальном API Qwen (только на OpenRouter за $0.45/$3.20 за 1M токенов).

## Что попробовать дальше

1. **Сравнить с Llama 3.1 70B**: Qwen 3.8 27B быстрее, но Llama может выигрывать в точности на некоторых задачах.
2. **Оптимизировать кванты**: Попробуйте Q4_K_M для баланса скорости и качества на слабых картах.
3. **Интегрировать в RAG**: Модель хорошо работает с длинными документами — подходит для чат-ботов с базой знаний.
4. **Тестировать YARN**: Если нужны контексты >262K, поэкспериментируйте с --rope-scaling yarn.

Демо-сервер автора статьи (может быть недоступен из-за нагрузки): habr.acloud.app. Веса модели лежат на Hugging Face под лицензией Apache 2.0 — можно использовать в коммерческих продуктах.

## Источники

- Habr AI: Вышла новая модель: Qwen 3.8 27B
