# Llama: как установить модуль и запустить модель локально
Каноническая страница: https://plainews.ru/posts/llama-kak-ustanovit-modul
Опубликовано: 2026-10-06T06:41:04.115Z

Разбираем, как установить модуль Llama через pip, Ollama и llama.cpp — от первой команды до запуска модели локально на вашем компьютере.
# Llama: как установить модуль и запустить модель локально

Установить модуль Llama можно тремя способами: через pip (официальный пакет Meta), через Ollama (самый простой путь для новичков) или собрав llama.cpp из исходников. Ниже — пошаговые инструкции для каждого варианта с реальными командами из официальных репозиториев.

---

## Что такое Llama и зачем устанавливать модуль

Llama (Large Language Model Meta AI) — семейство открытых языковых моделей от Meta, выпущенных начиная с февраля 2023 года. Веса моделей распространяются свободно, поэтому их можно запускать локально — без облака и без абонентской платы. Чтобы работать с моделью из кода или терминала, нужно установить соответствующий модуль или инструмент.

---

## Способ 1. Установка через pip — официальный пакет Meta

Это путь для разработчиков, которые хотят работать с моделями Llama напрямую из Python-кода. Репозиторий meta-llama/llama на GitHub содержит inference-код и стартовые скрипты для моделей от 7B до 70B параметров.

### Шаг 1. Клонируйте репозиторий

```bash
git clone https://github.com/meta-llama/llama.git
cd llama
```

### Шаг 2. Установите зависимости

```bash
pip install -e .
```

Флаг -e устанавливает пакет в режиме «editable» — изменения в коде репозитория сразу отражаются в установленном модуле без переустановки.

### Шаг 3. Скачайте веса модели

Веса распространяются через официальный сайт Meta. После одобрения заявки вы получите ссылки для скачивания. Запустите скрипт загрузки:

```bash
bash download.sh
```

Скрипт запросит URL, который пришёл вам на почту после регистрации на сайте Meta.

> **Важно.** Без одобренной заявки на доступ скрипт `download.sh` не скачает веса — он завершится с ошибкой. Регистрация бесплатна, но занимает от нескольких минут до нескольких часов.

---

## Способ 2. Установка через Ollama — самый быстрый старт

Ollama — платформа с открытым исходным кодом, разработанная в 2023 году Джеффри Морганом и Майклом Чангом. Она позволяет скачать и запустить модель Llama одной командой, без ручной работы с весами и зависимостями.

### Шаг 1. Установите Ollama

**macOS и Linux:**

```bash
curl -fsSL https://ollama.com/install.sh | sh
```

**Windows:** скачайте установщик с официального сайта ollama.com и запустите его.

**Docker:**

```bash
docker pull ollama/ollama
```

### Шаг 2. Запустите сервер Ollama

```bash
ollama serve
```

### Шаг 3. Скачайте и запустите модель Llama

```bash
ollama run llama3
```

Команда run автоматически скачивает модель при первом запуске и сразу открывает интерактивный чат в терминале. Для загрузки без запуска используйте:

```bash
ollama pull llama3
```

### Шаг 4. Список доступных моделей

```bash
ollama list
```

> **Важно.** Для запуска модели llama3 (8B) потребуется не менее 8 ГБ оперативной памяти. Модели большего размера требуют пропорционально больше RAM или VRAM видеокарты.

---

## Способ 3. Установка llama.cpp — для слабого железа

llama.cpp — минималистичный движок на C++ для локального запуска моделей Llama. Он работает даже без GPU и поддерживает квантизованные модели, которые занимают значительно меньше памяти.

### Шаг 1. Клонируйте репозиторий и соберите проект

```bash
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make
```

### Шаг 2. Скачайте квантизованную модель

Готовые GGUF-файлы моделей доступны на Hugging Face. После скачивания поместите файл в папку models/.

### Шаг 3. Запустите инференс

```bash
./llama-cli -m models/llama-3-8b.Q4_K_M.gguf -p "Привет! Расскажи о себе." -n 200
```

Флаг -m указывает путь к модели, -p — промпт, -n — максимальное количество токенов в ответе.

---

## Сравнение трёх способов установки

| Критерий | pip + meta-llama | Ollama | llama.cpp |
| --- | --- | --- | --- |
| Сложность установки | Средняя | Низкая | Средняя |
| Нужен GPU | Желательно | Желательно | Нет |
| Работа из Python | Да | Через API | Нет (C++) |
| Скорость старта | Медленная | Быстрая | Средняя |
| Подходит новичкам | Нет | Да | Нет |

---

## Типичные ошибки и как их исправить

**Ошибка: `command not found: ollama`** Ollama не добавлена в PATH. Перезапустите терминал после установки или добавьте путь вручную: export PATH=$PATH:/usr/local/bin.

**Ошибка: `pip install -e .` завершается с ошибкой зависимостей** Убедитесь, что используете Python 3.8 или новее: python --version. Создайте виртуальное окружение перед установкой:

```bash
python -m venv venv
source venv/bin/activate  # Linux/macOS
venv\Scripts\activate     # Windows
```

**Ошибка: модель не запускается, процесс завершается сразу** Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера (ollama run llama3:8b вместо llama3:70b) или квантизованную версию через llama.cpp.

**Ошибка: `make` не найден на Windows** На Windows для сборки llama.cpp нужен компилятор. Установите w64devkit или используйте WSL (Windows Subsystem for Linux).

---

## FAQ

### Нужна ли регистрация для установки Llama?

Для установки инструментов (Ollama, llama.cpp) регистрация не нужна. Для скачивания официальных весов от Meta через репозиторий meta-llama/llama потребуется подать заявку на сайте Meta и дождаться одобрения.

### Можно ли запустить Llama без видеокарты?

Да. llama.cpp специально оптимизирован для работы на CPU. Ollama тоже поддерживает режим без GPU, но скорость генерации будет значительно ниже — особенно для больших моделей.

### Какую версию модели выбрать для начала?

Для первого знакомства оптимален llama3 (8B параметров) через Ollama — он запускается одной командой и работает на большинстве современных компьютеров с 8–16 ГБ RAM.

### Как обновить модель в Ollama?

```bash
ollama pull llama3
```

Команда pull скачивает актуальную версию модели, если она отличается от установленной.

### Можно ли использовать Llama через Docker?

Да. Официальный образ Ollama доступен на Docker Hub:

```bash
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
```

После запуска контейнера API доступен на http://localhost:11434.

---

## Источники

- https://github.com/meta-llama/llama
- https://github.com/ollama/ollama
- https://github.com/ollama/ollama/releases
- https://digital-razor.ru/media/articles/guides/llama-cpp-complete-guide/
- https://ru.wikipedia.org/wiki/LLaMA
- https://ru.wikipedia.org/wiki/Ollama
