Llama: как установить и запустить локально — полный гайд

Llama — семейство открытых языковых моделей от Meta. Запустить их можно прямо на своём компьютере, без облака и подписок. В этом гайде разберём два основных пути: через Ollama (проще всего) и через llama.cpp (больше контроля).


Способ 1: Ollama — самый быстрый старт

Ollama — это оболочка, которая сама скачивает модели и управляет ими. Идеально, если вы хотите просто поговорить с Llama без лишних настроек.

Шаг 1. Установите Ollama

Перейдите на ollama.com и скачайте установщик для вашей ОС (macOS, Windows, Linux). Установка стандартная — как любое приложение.

Шаг 2. Запустите модель

После установки откройте терминал и выполните команду. Ollama сама скачает модель, если её ещё нет локально:

bash
ollama run llama3.2

Для более мощной версии (требует больше RAM):

bash
ollama run llama3.1:8b-instruct-q3_K_L

Или флагманскую 70B (нужно много VRAM/RAM):

bash
ollama run llama3:70b-instruct-q3_K_L

Шаг 3. Начните диалог

После загрузки модели прямо в терминале появится приглашение >>>. Вводите запросы и получайте ответы. Для выхода — /bye.


Способ 2: llama.cpp — через менеджер пакетов

llama.cpp — это движок для запуска моделей в формате GGUF. Подходит, если нужна гибкость или интеграция в свои скрипты.

macOS и Linux — через Homebrew

bash
brew install llama.cpp

Windows — через Winget

bash
winget install llama.cpp

Через Conda

bash
conda install -c conda-forge llama.cpp

Проверка установки

bash
llama-cli --version

Способ 3: Автоматический скрипт llama-install.sh

Скрипт сам определяет вашу ОС, архитектуру и тип GPU (CUDA, ROCm, Vulkan, Metal) и устанавливает подходящий бинарник.

Linux / macOS:

bash
curl -fsSL https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.sh | bash

Windows (PowerShell):

plain
irm https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.ps1 | iex

Способ 4: Сборка из исходников (для GPU-ускорения)

Если хотите использовать CUDA или другое GPU-ускорение — собирайте из исходников. Это даёт максимальную производительность.

Шаг 1. Клонируйте репозиторий

bash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

Шаг 2. Базовая сборка (CPU)

bash
cmake -B build && cmake --build build

Шаг 3. Загрузите модель в формате GGUF

Модели в формате GGUF доступны на Hugging Face. Скачайте нужный файл и укажите путь при запуске:

bash
./build/bin/llama-cli -m ./models/llama-3.2.gguf -p "Привет! Расскажи о себе."

Сравнение способов установки

СпособСложностьGPU-ускорениеЛучше всего для
Ollama⭐ ЛегкоАвтоматическиБыстрый старт, чат
Homebrew / Winget⭐⭐ СреднеОграниченоСкрипты, CLI
llama-install.sh⭐⭐ СреднеДа (авто)Универсальная установка
Сборка из исходников⭐⭐⭐ СложноПолноеМаксимальная гибкость

Типичные ошибки и как их исправить

`command not found: ollama` — Ollama не добавлена в PATH. Перезапустите терминал или добавьте путь вручную.

`command not found: llama-cli` — после установки через brew перезапустите терминал: source ~/.zshrc или source ~/.bashrc.

Модель зависает или работает очень медленно — не хватает RAM. Попробуйте модель меньшего размера (1B вместо 8B) или квантизованную версию (q3, q4).

Ошибка при сборке CMake — убедитесь, что установлены cmake и git. На Ubuntu: sudo apt install cmake git build-essential.

Ollama не видит GPU — убедитесь, что установлены актуальные драйверы NVIDIA и CUDA Toolkit.


FAQ

Llama — это платно?

Нет. Модели Llama от Meta распространяются бесплатно для большинства сценариев использования. Ollama и llama.cpp — тоже бесплатные open-source инструменты.

Какую версию Llama выбрать для начала?

Начните с llama3.2 через Ollama — это модель 3B, которая работает даже на ноутбуке с 8 ГБ RAM и даёт хорошее качество ответов.

Нужен ли интернет для работы?

Только для первоначальной загрузки модели. После скачивания Llama работает полностью офлайн.

Можно ли использовать Llama на Windows без WSL?

Да. Ollama имеет нативный Windows-установщик. llama.cpp устанавливается через Winget или скрипт install.ps1.

Чем отличается llama.cpp от Ollama?

Ollama — это удобная оболочка над llama.cpp с автоматическим управлением моделями и REST API. llama.cpp — низкоуровневый движок с большим контролем над параметрами запуска.


Источники

  • https://mintlify.wiki/ggml-org/llama.cpp/installation
  • https://mintlify.wiki/ggml-org/llama.cpp/quickstart
  • https://github.com/ggml-org/llama-install.sh/blob/master/README.md
  • https://mintlify.wiki/ggml-org/llama.cpp/development/building
  • https://ollama.com/library/llama3.2
  • https://registry.ollama.com/library/llama3.1:8b-instruct-q3_K_L
  • https://registry.ollama.com/library/llama3:70b-instruct-q3_K_L
  • https://mintlify.wiki/ollama/ollama/cli/run