Llama как установить: пошаговый гайд для запуска модели локально

Llama от Meta — одна из самых популярных открытых языковых моделей. Самый простой способ запустить её на своём компьютере — использовать Ollama, инструмент, который берёт на себя скачивание, управление и запуск моделей одной командой.


Что такое Ollama и зачем он нужен

Ollama — это CLI-инструмент, который позволяет запускать большие языковые модели локально без сложной настройки окружения. Он автоматически скачивает модель из реестра, если она ещё не загружена, и сразу запускает интерактивный чат.

Поддерживаемые платформы: macOS, Linux, Windows.


Шаг 1. Установка Ollama

Перейдите на официальный сайт ollama.com и скачайте установщик для вашей ОС.

macOS и Windows — установка через графический инсталлятор.

Linux — установка одной командой в терминале:

bash
curl -fsSL https://ollama.com/install.sh | sh

После установки проверьте, что Ollama доступна:

bash
ollama --version

Шаг 2. Запуск Llama

Ollama использует команду run — она скачивает модель из реестра (если её нет локально) и сразу запускает интерактивный режим.

Запустить Llama 3.2 (рекомендуется для старта)

Llama 3.2 — актуальные мультиязычные модели Meta с параметрами 1B и 3B. Оптимизированы для диалога, суммаризации и агентных задач.

bash
ollama run llama3.2

Запустить Llama 3.1 (8B, расширенный контекст)

Llama 3.1 в варианте 8B поддерживает контекстное окно 128K токенов и улучшенный инструментальный вызов.

bash
ollama run llama3.1

Если нужна конкретная квантизованная версия — укажите тег явно:

bash
ollama run llama3.1:8b-text-q3_K_L

Шаг 3. Работа в интерактивном режиме

После запуска команды ollama run вы попадаете в интерактивный чат прямо в терминале. Просто вводите текст и нажимайте Enter.

plain
>>> Привет! Что ты умеешь?

Чтобы выйти из режима — введите /bye или нажмите Ctrl + D.


Шаг 4. Одиночный запрос без интерактивного режима

Если нужно получить один ответ и вернуться в терминал — передайте промпт сразу в команду:

bash
ollama run llama3.2 "Объясни, что такое нейронная сеть, простыми словами"

Вывод в формате JSON

bash
ollama run llama3.2 --format json "Перечисли три столицы Европы"

Держать модель загруженной в памяти

По умолчанию модель выгружается после завершения сессии. Чтобы она оставалась в памяти:

bash
ollama run llama3.2 --keepalive 60m

Какую модель выбрать

МодельПараметрыКонтекстКогда использовать
llama3.21B / 3BСтандартныйБыстрые ответы, слабое железо
llama3.18B128K токеновДлинные документы, сложные задачи
llama3.1:8b-text-q3_K_L8B (квантизация Q3)128K токеновЭкономия RAM при сохранении качества

Типичные ошибки и как их исправить

`ollama: command not found` Ollama не добавлена в PATH. На Linux перезапустите терминал после установки или выполните source ~/.bashrc.

`Error: model not found` Проверьте правильность названия модели. Список доступных моделей смотрите на registry.ollama.com.

Модель зависает при загрузке Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера — например, llama3.2 вместо llama3.1.

Медленная генерация текста Без GPU модель работает на CPU — это нормально, но медленнее. На Apple Silicon (M1/M2/M3) Ollama автоматически использует Neural Engine.


FAQ

Нужна ли видеокарта для запуска Llama?

Нет. Ollama запускает модели на CPU. GPU ускоряет генерацию, но не обязателен. На Apple Silicon используется встроенный Neural Engine.

Можно ли использовать Llama на Windows?

Да. Ollama поддерживает Windows — скачайте установщик с официального сайта ollama.com.

Как посмотреть список уже скачанных моделей?

bash
ollama list

Как удалить модель, чтобы освободить место?

bash
ollama rm llama3.2

Llama понимает русский язык?

Llama 3.2 позиционируется как мультиязычная модель и работает с русским текстом. Качество ответов на русском ниже, чем на английском, но для большинства задач достаточно.


Источники

  • https://mintlify.wiki/ollama/ollama/cli/run
  • https://mintlify.wiki/ollama/ollama/cli/overview
  • https://registry.ollama.com/library/llama3.2:latest
  • https://registry.ollama.com/library/llama3.1:8b-text-q3_K_L