# Llama: как установить и запустить локально — полный гайд
Каноническая страница: https://plainews.ru/posts/llama-kak-ustanovit-2026-09-21
Опубликовано: 2026-09-21T06:41:08.736Z

Разбираем, как установить Llama через Ollama, Homebrew, Winget и из исходников. После этого гайда вы запустите модель локально за 10 минут.
# Llama: как установить и запустить локально — полный гайд

Llama — семейство открытых языковых моделей от Meta. Запустить их можно прямо на своём компьютере, без облака и подписок. В этом гайде разберём два основных пути: через **Ollama** (проще всего) и через **llama.cpp** (больше контроля).

---

## Способ 1: Ollama — самый быстрый старт

Ollama — это оболочка, которая сама скачивает модели и управляет ими. Идеально, если вы хотите просто поговорить с Llama без лишних настроек.

### Шаг 1. Установите Ollama

Перейдите на ollama.com и скачайте установщик для вашей ОС (macOS, Windows, Linux). Установка стандартная — как любое приложение.

### Шаг 2. Запустите модель

После установки откройте терминал и выполните команду. Ollama сама скачает модель, если её ещё нет локально:

```bash
ollama run llama3.2
```

Для более мощной версии (требует больше RAM):

```bash
ollama run llama3.1:8b-instruct-q3_K_L
```

Или флагманскую 70B (нужно много VRAM/RAM):

```bash
ollama run llama3:70b-instruct-q3_K_L
```

### Шаг 3. Начните диалог

После загрузки модели прямо в терминале появится приглашение >>>. Вводите запросы и получайте ответы. Для выхода — /bye.

> **Важно.** Модель 3B занимает около 2 ГБ, 8B — около 5 ГБ. Убедитесь, что на диске достаточно места, а RAM — не менее 8 ГБ для комфортной работы с 3B/8B моделями.

---

## Способ 2: llama.cpp — через менеджер пакетов

llama.cpp — это движок для запуска моделей в формате GGUF. Подходит, если нужна гибкость или интеграция в свои скрипты.

### macOS и Linux — через Homebrew

```bash
brew install llama.cpp
```

### Windows — через Winget

```bash
winget install llama.cpp
```

### Через Conda

```bash
conda install -c conda-forge llama.cpp
```

### Проверка установки

```bash
llama-cli --version
```

---

## Способ 3: Автоматический скрипт llama-install.sh

Скрипт сам определяет вашу ОС, архитектуру и тип GPU (CUDA, ROCm, Vulkan, Metal) и устанавливает подходящий бинарник.

**Linux / macOS:**

```bash
curl -fsSL https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.sh | bash
```

**Windows (PowerShell):**

```plain
irm https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.ps1 | iex
```

> **Важно.** Перед запуском скриптов из интернета убедитесь, что доверяете источнику. Это официальный репозиторий ggml-org на GitHub.

---

## Способ 4: Сборка из исходников (для GPU-ускорения)

Если хотите использовать CUDA или другое GPU-ускорение — собирайте из исходников. Это даёт максимальную производительность.

### Шаг 1. Клонируйте репозиторий

```bash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
```

### Шаг 2. Базовая сборка (CPU)

```bash
cmake -B build && cmake --build build
```

### Шаг 3. Загрузите модель в формате GGUF

Модели в формате GGUF доступны на Hugging Face. Скачайте нужный файл и укажите путь при запуске:

```bash
./build/bin/llama-cli -m ./models/llama-3.2.gguf -p "Привет! Расскажи о себе."
```

---

## Сравнение способов установки

| Способ | Сложность | GPU-ускорение | Лучше всего для |
| --- | --- | --- | --- |
| Ollama | ⭐ Легко | Автоматически | Быстрый старт, чат |
| Homebrew / Winget | ⭐⭐ Средне | Ограничено | Скрипты, CLI |
| llama-install.sh | ⭐⭐ Средне | Да (авто) | Универсальная установка |
| Сборка из исходников | ⭐⭐⭐ Сложно | Полное | Максимальная гибкость |

---

## Типичные ошибки и как их исправить

**`command not found: ollama`** — Ollama не добавлена в PATH. Перезапустите терминал или добавьте путь вручную.

**`command not found: llama-cli`** — после установки через brew перезапустите терминал: source ~/.zshrc или source ~/.bashrc.

**Модель зависает или работает очень медленно** — не хватает RAM. Попробуйте модель меньшего размера (1B вместо 8B) или квантизованную версию (q3, q4).

**Ошибка при сборке CMake** — убедитесь, что установлены cmake и git. На Ubuntu: sudo apt install cmake git build-essential.

**Ollama не видит GPU** — убедитесь, что установлены актуальные драйверы NVIDIA и CUDA Toolkit.

---

## FAQ

### Llama — это платно?

Нет. Модели Llama от Meta распространяются бесплатно для большинства сценариев использования. Ollama и llama.cpp — тоже бесплатные open-source инструменты.

### Какую версию Llama выбрать для начала?

Начните с llama3.2 через Ollama — это модель 3B, которая работает даже на ноутбуке с 8 ГБ RAM и даёт хорошее качество ответов.

### Нужен ли интернет для работы?

Только для первоначальной загрузки модели. После скачивания Llama работает полностью офлайн.

### Можно ли использовать Llama на Windows без WSL?

Да. Ollama имеет нативный Windows-установщик. llama.cpp устанавливается через Winget или скрипт install.ps1.

### Чем отличается llama.cpp от Ollama?

Ollama — это удобная оболочка над llama.cpp с автоматическим управлением моделями и REST API. llama.cpp — низкоуровневый движок с большим контролем над параметрами запуска.

---

## Источники

- https://mintlify.wiki/ggml-org/llama.cpp/installation
- https://mintlify.wiki/ggml-org/llama.cpp/quickstart
- https://github.com/ggml-org/llama-install.sh/blob/master/README.md
- https://mintlify.wiki/ggml-org/llama.cpp/development/building
- https://ollama.com/library/llama3.2
- https://registry.ollama.com/library/llama3.1:8b-instruct-q3_K_L
- https://registry.ollama.com/library/llama3:70b-instruct-q3_K_L
- https://mintlify.wiki/ollama/ollama/cli/run
