Llama: как установить модуль и запустить модель локально

Установить модуль Llama можно тремя способами: через pip (официальный пакет Meta), через Ollama (самый простой путь для новичков) или собрав llama.cpp из исходников. Ниже — пошаговые инструкции для каждого варианта с реальными командами из официальных репозиториев.


Что такое Llama и зачем устанавливать модуль

Llama (Large Language Model Meta AI) — семейство открытых языковых моделей от Meta, выпущенных начиная с февраля 2023 года. Веса моделей распространяются свободно, поэтому их можно запускать локально — без облака и без абонентской платы. Чтобы работать с моделью из кода или терминала, нужно установить соответствующий модуль или инструмент.


Способ 1. Установка через pip — официальный пакет Meta

Это путь для разработчиков, которые хотят работать с моделями Llama напрямую из Python-кода. Репозиторий meta-llama/llama на GitHub содержит inference-код и стартовые скрипты для моделей от 7B до 70B параметров.

Шаг 1. Клонируйте репозиторий

bash
git clone https://github.com/meta-llama/llama.git
cd llama

Шаг 2. Установите зависимости

bash
pip install -e .

Флаг -e устанавливает пакет в режиме «editable» — изменения в коде репозитория сразу отражаются в установленном модуле без переустановки.

Шаг 3. Скачайте веса модели

Веса распространяются через официальный сайт Meta. После одобрения заявки вы получите ссылки для скачивания. Запустите скрипт загрузки:

bash
bash download.sh

Скрипт запросит URL, который пришёл вам на почту после регистрации на сайте Meta.


Способ 2. Установка через Ollama — самый быстрый старт

Ollama — платформа с открытым исходным кодом, разработанная в 2023 году Джеффри Морганом и Майклом Чангом. Она позволяет скачать и запустить модель Llama одной командой, без ручной работы с весами и зависимостями.

Шаг 1. Установите Ollama

macOS и Linux:

bash
curl -fsSL https://ollama.com/install.sh | sh

Windows: скачайте установщик с официального сайта ollama.com и запустите его.

Docker:

bash
docker pull ollama/ollama

Шаг 2. Запустите сервер Ollama

bash
ollama serve

Шаг 3. Скачайте и запустите модель Llama

bash
ollama run llama3

Команда run автоматически скачивает модель при первом запуске и сразу открывает интерактивный чат в терминале. Для загрузки без запуска используйте:

bash
ollama pull llama3

Шаг 4. Список доступных моделей

bash
ollama list

Способ 3. Установка llama.cpp — для слабого железа

llama.cpp — минималистичный движок на C++ для локального запуска моделей Llama. Он работает даже без GPU и поддерживает квантизованные модели, которые занимают значительно меньше памяти.

Шаг 1. Клонируйте репозиторий и соберите проект

bash
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make

Шаг 2. Скачайте квантизованную модель

Готовые GGUF-файлы моделей доступны на Hugging Face. После скачивания поместите файл в папку models/.

Шаг 3. Запустите инференс

bash
./llama-cli -m models/llama-3-8b.Q4_K_M.gguf -p "Привет! Расскажи о себе." -n 200

Флаг -m указывает путь к модели, -p — промпт, -n — максимальное количество токенов в ответе.


Сравнение трёх способов установки

Критерийpip + meta-llamaOllamallama.cpp
Сложность установкиСредняяНизкаяСредняя
Нужен GPUЖелательноЖелательноНет
Работа из PythonДаЧерез APIНет (C++)
Скорость стартаМедленнаяБыстраяСредняя
Подходит новичкамНетДаНет

Типичные ошибки и как их исправить

Ошибка: `command not found: ollama` Ollama не добавлена в PATH. Перезапустите терминал после установки или добавьте путь вручную: export PATH=$PATH:/usr/local/bin.

Ошибка: `pip install -e .` завершается с ошибкой зависимостей Убедитесь, что используете Python 3.8 или новее: python --version. Создайте виртуальное окружение перед установкой:

bash
python -m venv venv
source venv/bin/activate  # Linux/macOS
venv\Scripts\activate     # Windows

Ошибка: модель не запускается, процесс завершается сразу Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера (ollama run llama3:8b вместо llama3:70b) или квантизованную версию через llama.cpp.

Ошибка: `make` не найден на Windows На Windows для сборки llama.cpp нужен компилятор. Установите w64devkit или используйте WSL (Windows Subsystem for Linux).


FAQ

Нужна ли регистрация для установки Llama?

Для установки инструментов (Ollama, llama.cpp) регистрация не нужна. Для скачивания официальных весов от Meta через репозиторий meta-llama/llama потребуется подать заявку на сайте Meta и дождаться одобрения.

Можно ли запустить Llama без видеокарты?

Да. llama.cpp специально оптимизирован для работы на CPU. Ollama тоже поддерживает режим без GPU, но скорость генерации будет значительно ниже — особенно для больших моделей.

Какую версию модели выбрать для начала?

Для первого знакомства оптимален llama3 (8B параметров) через Ollama — он запускается одной командой и работает на большинстве современных компьютеров с 8–16 ГБ RAM.

Как обновить модель в Ollama?

bash
ollama pull llama3

Команда pull скачивает актуальную версию модели, если она отличается от установленной.

Можно ли использовать Llama через Docker?

Да. Официальный образ Ollama доступен на Docker Hub:

bash
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

После запуска контейнера API доступен на http://localhost:11434.


Источники

  • https://github.com/meta-llama/llama
  • https://github.com/ollama/ollama
  • https://github.com/ollama/ollama/releases
  • https://digital-razor.ru/media/articles/guides/llama-cpp-complete-guide/
  • https://ru.wikipedia.org/wiki/LLaMA
  • https://ru.wikipedia.org/wiki/Ollama