# Llama как установить: пошаговый гайд для запуска модели локально
Каноническая страница: https://plainews.ru/posts/llama-kak-ustanovit-cherez-ollama
Опубликовано: 2026-09-06T06:41:09.221Z

Пошаговый гайд: как установить Llama локально через Ollama, запустить первую модель и избежать типичных ошибок. Работает на Mac, Linux и Windows.
# Llama как установить: пошаговый гайд для запуска модели локально

Llama от Meta — одна из самых популярных открытых языковых моделей. Самый простой способ запустить её на своём компьютере — использовать **Ollama**, инструмент, который берёт на себя скачивание, управление и запуск моделей одной командой.

---

## Что такое Ollama и зачем он нужен

Ollama — это CLI-инструмент, который позволяет запускать большие языковые модели локально без сложной настройки окружения. Он автоматически скачивает модель из реестра, если она ещё не загружена, и сразу запускает интерактивный чат.

Поддерживаемые платформы: **macOS, Linux, Windows**.

---

## Шаг 1. Установка Ollama

Перейдите на официальный сайт ollama.com и скачайте установщик для вашей ОС.

**macOS и Windows** — установка через графический инсталлятор.

**Linux** — установка одной командой в терминале:

```bash
curl -fsSL https://ollama.com/install.sh | sh
```

После установки проверьте, что Ollama доступна:

```bash
ollama --version
```

---

## Шаг 2. Запуск Llama

Ollama использует команду run — она скачивает модель из реестра (если её нет локально) и сразу запускает интерактивный режим.

### Запустить Llama 3.2 (рекомендуется для старта)

Llama 3.2 — актуальные мультиязычные модели Meta с параметрами 1B и 3B. Оптимизированы для диалога, суммаризации и агентных задач.

```bash
ollama run llama3.2
```

### Запустить Llama 3.1 (8B, расширенный контекст)

Llama 3.1 в варианте 8B поддерживает контекстное окно 128K токенов и улучшенный инструментальный вызов.

```bash
ollama run llama3.1
```

Если нужна конкретная квантизованная версия — укажите тег явно:

```bash
ollama run llama3.1:8b-text-q3_K_L
```

> **Важно.** Первый запуск скачивает модель — это может занять несколько минут в зависимости от скорости интернета и размера модели. Модель 3B весит около 2 ГБ, 8B — около 5 ГБ.

---

## Шаг 3. Работа в интерактивном режиме

После запуска команды ollama run вы попадаете в интерактивный чат прямо в терминале. Просто вводите текст и нажимайте Enter.

```plain
>>> Привет! Что ты умеешь?
```

Чтобы выйти из режима — введите /bye или нажмите Ctrl + D.

---

## Шаг 4. Одиночный запрос без интерактивного режима

Если нужно получить один ответ и вернуться в терминал — передайте промпт сразу в команду:

```bash
ollama run llama3.2 "Объясни, что такое нейронная сеть, простыми словами"
```

### Вывод в формате JSON

```bash
ollama run llama3.2 --format json "Перечисли три столицы Европы"
```

### Держать модель загруженной в памяти

По умолчанию модель выгружается после завершения сессии. Чтобы она оставалась в памяти:

```bash
ollama run llama3.2 --keepalive 60m
```

---

## Какую модель выбрать

| Модель | Параметры | Контекст | Когда использовать |
| --- | --- | --- | --- |
| llama3.2 | 1B / 3B | Стандартный | Быстрые ответы, слабое железо |
| llama3.1 | 8B | 128K токенов | Длинные документы, сложные задачи |
| llama3.1:8b-text-q3_K_L | 8B (квантизация Q3) | 128K токенов | Экономия RAM при сохранении качества |

> **Важно.** Для моделей 8B рекомендуется минимум 8 ГБ оперативной памяти. Модели 1B–3B запускаются даже на 4 ГБ RAM.

---

## Типичные ошибки и как их исправить

**`ollama: command not found`** Ollama не добавлена в PATH. На Linux перезапустите терминал после установки или выполните source ~/.bashrc.

**`Error: model not found`** Проверьте правильность названия модели. Список доступных моделей смотрите на registry.ollama.com.

**Модель зависает при загрузке** Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера — например, llama3.2 вместо llama3.1.

**Медленная генерация текста** Без GPU модель работает на CPU — это нормально, но медленнее. На Apple Silicon (M1/M2/M3) Ollama автоматически использует Neural Engine.

---

## FAQ

### Нужна ли видеокарта для запуска Llama?

Нет. Ollama запускает модели на CPU. GPU ускоряет генерацию, но не обязателен. На Apple Silicon используется встроенный Neural Engine.

### Можно ли использовать Llama на Windows?

Да. Ollama поддерживает Windows — скачайте установщик с официального сайта ollama.com.

### Как посмотреть список уже скачанных моделей?

```bash
ollama list
```

### Как удалить модель, чтобы освободить место?

```bash
ollama rm llama3.2
```

### Llama понимает русский язык?

Llama 3.2 позиционируется как мультиязычная модель и работает с русским текстом. Качество ответов на русском ниже, чем на английском, но для большинства задач достаточно.

---

## Источники

- https://mintlify.wiki/ollama/ollama/cli/run
- https://mintlify.wiki/ollama/ollama/cli/overview
- https://registry.ollama.com/library/llama3.2:latest
- https://registry.ollama.com/library/llama3.1:8b-text-q3_K_L
