Llama как установить: пошаговый гайд для запуска модели локально
Llama от Meta — одна из самых популярных открытых языковых моделей. Самый простой способ запустить её на своём компьютере — использовать Ollama, инструмент, который берёт на себя скачивание, управление и запуск моделей одной командой.
Что такое Ollama и зачем он нужен
Ollama — это CLI-инструмент, который позволяет запускать большие языковые модели локально без сложной настройки окружения. Он автоматически скачивает модель из реестра, если она ещё не загружена, и сразу запускает интерактивный чат.
Поддерживаемые платформы: macOS, Linux, Windows.
Шаг 1. Установка Ollama
Перейдите на официальный сайт ollama.com и скачайте установщик для вашей ОС.
macOS и Windows — установка через графический инсталлятор.
Linux — установка одной командой в терминале:
curl -fsSL https://ollama.com/install.sh | shПосле установки проверьте, что Ollama доступна:
ollama --versionШаг 2. Запуск Llama
Ollama использует команду run — она скачивает модель из реестра (если её нет локально) и сразу запускает интерактивный режим.
Запустить Llama 3.2 (рекомендуется для старта)
Llama 3.2 — актуальные мультиязычные модели Meta с параметрами 1B и 3B. Оптимизированы для диалога, суммаризации и агентных задач.
ollama run llama3.2Запустить Llama 3.1 (8B, расширенный контекст)
Llama 3.1 в варианте 8B поддерживает контекстное окно 128K токенов и улучшенный инструментальный вызов.
ollama run llama3.1Если нужна конкретная квантизованная версия — укажите тег явно:
ollama run llama3.1:8b-text-q3_K_LШаг 3. Работа в интерактивном режиме
После запуска команды ollama run вы попадаете в интерактивный чат прямо в терминале. Просто вводите текст и нажимайте Enter.
>>> Привет! Что ты умеешь?Чтобы выйти из режима — введите /bye или нажмите Ctrl + D.
Шаг 4. Одиночный запрос без интерактивного режима
Если нужно получить один ответ и вернуться в терминал — передайте промпт сразу в команду:
ollama run llama3.2 "Объясни, что такое нейронная сеть, простыми словами"Вывод в формате JSON
ollama run llama3.2 --format json "Перечисли три столицы Европы"Держать модель загруженной в памяти
По умолчанию модель выгружается после завершения сессии. Чтобы она оставалась в памяти:
ollama run llama3.2 --keepalive 60mКакую модель выбрать
| Модель | Параметры | Контекст | Когда использовать |
|---|---|---|---|
| llama3.2 | 1B / 3B | Стандартный | Быстрые ответы, слабое железо |
| llama3.1 | 8B | 128K токенов | Длинные документы, сложные задачи |
| llama3.1:8b-text-q3_K_L | 8B (квантизация Q3) | 128K токенов | Экономия RAM при сохранении качества |
Типичные ошибки и как их исправить
`ollama: command not found` Ollama не добавлена в PATH. На Linux перезапустите терминал после установки или выполните source ~/.bashrc.
`Error: model not found` Проверьте правильность названия модели. Список доступных моделей смотрите на registry.ollama.com.
Модель зависает при загрузке Скорее всего, не хватает оперативной памяти. Попробуйте модель меньшего размера — например, llama3.2 вместо llama3.1.
Медленная генерация текста Без GPU модель работает на CPU — это нормально, но медленнее. На Apple Silicon (M1/M2/M3) Ollama автоматически использует Neural Engine.
FAQ
Нужна ли видеокарта для запуска Llama?
Нет. Ollama запускает модели на CPU. GPU ускоряет генерацию, но не обязателен. На Apple Silicon используется встроенный Neural Engine.
Можно ли использовать Llama на Windows?
Да. Ollama поддерживает Windows — скачайте установщик с официального сайта ollama.com.
Как посмотреть список уже скачанных моделей?
ollama listКак удалить модель, чтобы освободить место?
ollama rm llama3.2Llama понимает русский язык?
Llama 3.2 позиционируется как мультиязычная модель и работает с русским текстом. Качество ответов на русском ниже, чем на английском, но для большинства задач достаточно.
Источники
- https://mintlify.wiki/ollama/ollama/cli/run
- https://mintlify.wiki/ollama/ollama/cli/overview
- https://registry.ollama.com/library/llama3.2:latest
- https://registry.ollama.com/library/llama3.1:8b-text-q3_K_L

