Llama: как установить модуль и запустить модель локально
Установить модуль Llama можно тремя способами: через pip (официальный пакет Meta), через Ollama (самый простой путь для новичков) или собрав llama.cpp из исходников. Ниже — пошаговые инструкции для каждого варианта с реальными командами из официальных репозиториев.
Что такое Llama и зачем устанавливать модуль
Llama (Large Language Model Meta AI) — семейство открытых языковых моделей от Meta, выпущенных начиная с февраля 2023 года. Веса моделей распространяются свободно, поэтому их можно запускать локально — без облака и без абонентской платы. Чтобы работать с моделью из кода или терминала, нужно установить соответствующий модуль или инструмент.
Способ 1. Установка через pip — официальный пакет Meta
Это путь для разработчиков, которые хотят работать с моделями Llama напрямую из Python-кода. Репозиторий meta-llama/llama на GitHub содержит inference-код и стартовые скрипты для моделей от 7B до 70B параметров.
Шаг 1. Клонируйте репозиторий
git clone https://github.com/meta-llama/llama.git
cd llamaШаг 2. Установите зависимости
pip install -e .Флаг -e устанавливает пакет в режиме «editable» — изменения в коде репозитория сразу отражаются в установленном модуле без переустановки.
Шаг 3. Скачайте веса модели
Веса распространяются через официальный сайт Meta. После одобрения заявки вы получите ссылки для скачивания. Запустите скрипт загрузки:
bash download.shСкрипт запросит URL, который пришёл вам на почту после регистрации на сайте Meta.
Способ 2. Установка через Ollama — самый быстрый старт
Ollama — платформа с открытым исходным кодом, разработанная в 2023 году Джеффри Морганом и Майклом Чангом. Она позволяет скачать и запустить модель Llama одной командой, без ручной работы с весами и зависимостями.
Шаг 1. Установите Ollama
macOS и Linux:
curl -fsSL https://ollama.com/install.sh | shWindows: скачайте установщик с официального сайта ollama.com и запустите его.
Docker:
docker pull ollama/ollamaШаг 2. Запустите сервер Ollama
ollama serveШаг 3. Скачайте и запустите модель Llama
ollama run llama3Команда run автоматически скачивает модель при первом запуске и сразу открывает интерактивный чат в терминале. Для загрузки без запуска используйте:
ollama pull llama3Шаг 4. Список доступных моделей
ollama listСпособ 3. Установка llama.cpp — для слабого железа
llama.cpp — минималистичный движок на C++ для локального запуска моделей Llama. Он работает даже без GPU и поддерживает квантизованные модели, которые занимают значительно меньше памяти.
Шаг 1. Клонируйте репозиторий и соберите проект
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
makeШаг 2. Скачайте квантизованную модель
Готовые GGUF-файлы моделей доступны на Hugging Face. После скачивания поместите файл в папку models/.
Шаг 3. Запустите инференс
./llama-cli -m models/llama-3-8b.Q4_K_M.gguf -p "Привет! Расскажи о себе." -n 200Флаг -m указывает путь к модели, -p — промпт, -n — максимальное количество токенов в ответе.
Сравнение трёх способов установки
| Критерий | pip + meta-llama | Ollama | llama.cpp |
|---|---|---|---|
| Сложность установки | Средняя | Низкая | Средняя |
| Нужен GPU | Желательно | Желательно | Нет |
| Работа из Python | Да | Через API | Нет (C++) |
| Скорость старта | Медленная | Быстрая | Средняя |
| Подходит новичкам | Нет | Да | Нет |
Типичные ошибки и как их исправить
Ошибка: `command not found: ollama` Ollama не добавлена в PATH. Перезапустите терминал после установки или добавьте путь вручную: export PATH=$PATH:/usr/local/bin.
Ошибка: `pip install -e .` завершается с ошибкой зависимостей Убедитесь, что используете Python 3.8 или новее: python --version. Создайте виртуальное окружение перед установкой:
python -m venv venv
source venv/bin/activate # Linux/macOS
venv\Scripts\activate # WindowsОшибка: модель не запускается, процесс завершается сразу Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера (ollama run llama3:8b вместо llama3:70b) или квантизованную версию через llama.cpp.
Ошибка: `make` не найден на Windows На Windows для сборки llama.cpp нужен компилятор. Установите w64devkit или используйте WSL (Windows Subsystem for Linux).
FAQ
Нужна ли регистрация для установки Llama?
Для установки инструментов (Ollama, llama.cpp) регистрация не нужна. Для скачивания официальных весов от Meta через репозиторий meta-llama/llama потребуется подать заявку на сайте Meta и дождаться одобрения.
Можно ли запустить Llama без видеокарты?
Да. llama.cpp специально оптимизирован для работы на CPU. Ollama тоже поддерживает режим без GPU, но скорость генерации будет значительно ниже — особенно для больших моделей.
Какую версию модели выбрать для начала?
Для первого знакомства оптимален llama3 (8B параметров) через Ollama — он запускается одной командой и работает на большинстве современных компьютеров с 8–16 ГБ RAM.
Как обновить модель в Ollama?
ollama pull llama3Команда pull скачивает актуальную версию модели, если она отличается от установленной.
Можно ли использовать Llama через Docker?
Да. Официальный образ Ollama доступен на Docker Hub:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollamaПосле запуска контейнера API доступен на http://localhost:11434.
Источники
- https://github.com/meta-llama/llama
- https://github.com/ollama/ollama
- https://github.com/ollama/ollama/releases
- https://digital-razor.ru/media/articles/guides/llama-cpp-complete-guide/
- https://ru.wikipedia.org/wiki/LLaMA
- https://ru.wikipedia.org/wiki/Ollama
