Llama: как установить и запустить локально — полный гайд
Llama — семейство открытых языковых моделей от Meta. Запустить их можно прямо на своём компьютере, без облака и подписок. В этом гайде разберём два основных пути: через Ollama (проще всего) и через llama.cpp (больше контроля).
Способ 1: Ollama — самый быстрый старт
Ollama — это оболочка, которая сама скачивает модели и управляет ими. Идеально, если вы хотите просто поговорить с Llama без лишних настроек.
Шаг 1. Установите Ollama
Перейдите на ollama.com и скачайте установщик для вашей ОС (macOS, Windows, Linux). Установка стандартная — как любое приложение.
Шаг 2. Запустите модель
После установки откройте терминал и выполните команду. Ollama сама скачает модель, если её ещё нет локально:
ollama run llama3.2Для более мощной версии (требует больше RAM):
ollama run llama3.1:8b-instruct-q3_K_LИли флагманскую 70B (нужно много VRAM/RAM):
ollama run llama3:70b-instruct-q3_K_LШаг 3. Начните диалог
После загрузки модели прямо в терминале появится приглашение >>>. Вводите запросы и получайте ответы. Для выхода — /bye.
Способ 2: llama.cpp — через менеджер пакетов
llama.cpp — это движок для запуска моделей в формате GGUF. Подходит, если нужна гибкость или интеграция в свои скрипты.
macOS и Linux — через Homebrew
brew install llama.cppWindows — через Winget
winget install llama.cppЧерез Conda
conda install -c conda-forge llama.cppПроверка установки
llama-cli --versionСпособ 3: Автоматический скрипт llama-install.sh
Скрипт сам определяет вашу ОС, архитектуру и тип GPU (CUDA, ROCm, Vulkan, Metal) и устанавливает подходящий бинарник.
Linux / macOS:
curl -fsSL https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.sh | bashWindows (PowerShell):
irm https://raw.githubusercontent.com/ggml-org/llama-install.sh/master/install.ps1 | iexСпособ 4: Сборка из исходников (для GPU-ускорения)
Если хотите использовать CUDA или другое GPU-ускорение — собирайте из исходников. Это даёт максимальную производительность.
Шаг 1. Клонируйте репозиторий
git clone https://github.com/ggml-org/llama.cpp
cd llama.cppШаг 2. Базовая сборка (CPU)
cmake -B build && cmake --build buildШаг 3. Загрузите модель в формате GGUF
Модели в формате GGUF доступны на Hugging Face. Скачайте нужный файл и укажите путь при запуске:
./build/bin/llama-cli -m ./models/llama-3.2.gguf -p "Привет! Расскажи о себе."Сравнение способов установки
| Способ | Сложность | GPU-ускорение | Лучше всего для |
|---|---|---|---|
| Ollama | ⭐ Легко | Автоматически | Быстрый старт, чат |
| Homebrew / Winget | ⭐⭐ Средне | Ограничено | Скрипты, CLI |
| llama-install.sh | ⭐⭐ Средне | Да (авто) | Универсальная установка |
| Сборка из исходников | ⭐⭐⭐ Сложно | Полное | Максимальная гибкость |
Типичные ошибки и как их исправить
`command not found: ollama` — Ollama не добавлена в PATH. Перезапустите терминал или добавьте путь вручную.
`command not found: llama-cli` — после установки через brew перезапустите терминал: source ~/.zshrc или source ~/.bashrc.
Модель зависает или работает очень медленно — не хватает RAM. Попробуйте модель меньшего размера (1B вместо 8B) или квантизованную версию (q3, q4).
Ошибка при сборке CMake — убедитесь, что установлены cmake и git. На Ubuntu: sudo apt install cmake git build-essential.
Ollama не видит GPU — убедитесь, что установлены актуальные драйверы NVIDIA и CUDA Toolkit.
FAQ
Llama — это платно?
Нет. Модели Llama от Meta распространяются бесплатно для большинства сценариев использования. Ollama и llama.cpp — тоже бесплатные open-source инструменты.
Какую версию Llama выбрать для начала?
Начните с llama3.2 через Ollama — это модель 3B, которая работает даже на ноутбуке с 8 ГБ RAM и даёт хорошее качество ответов.
Нужен ли интернет для работы?
Только для первоначальной загрузки модели. После скачивания Llama работает полностью офлайн.
Можно ли использовать Llama на Windows без WSL?
Да. Ollama имеет нативный Windows-установщик. llama.cpp устанавливается через Winget или скрипт install.ps1.
Чем отличается llama.cpp от Ollama?
Ollama — это удобная оболочка над llama.cpp с автоматическим управлением моделями и REST API. llama.cpp — низкоуровневый движок с большим контролем над параметрами запуска.
Источники
- https://mintlify.wiki/ggml-org/llama.cpp/installation
- https://mintlify.wiki/ggml-org/llama.cpp/quickstart
- https://github.com/ggml-org/llama-install.sh/blob/master/README.md
- https://mintlify.wiki/ggml-org/llama.cpp/development/building
- https://ollama.com/library/llama3.2
- https://registry.ollama.com/library/llama3.1:8b-instruct-q3_K_L
- https://registry.ollama.com/library/llama3:70b-instruct-q3_K_L
- https://mintlify.wiki/ollama/ollama/cli/run

