← На главную
Гайды· 21.08.2026· 3 мин чтения

Как запустить Llama локально через Ollama: 8B, 70B и что потянет ПК

Llama — это веса Meta, не программа. Какие теги брать в Ollama, чем 3.2 отличается от 3.1 и почему 70B на ноутбуке — плохая идея.

Металлическая скульптура ламы на серверной полке с GPU — модель Llama, не животное
Материал подготовлен с помощью ИИ и проверен редактором

Llama — это семейство моделей Meta, а не программа. Ставить «Llama.exe» не нужно: веса качает рантайм. Самый короткий путь на своём компьютере — Ollama. Если её ещё нет, сначала поставьте рантайм по гайду как установить Ollama, затем вернитесь сюда и скачайте конкретную Llama.

Ниже — какие теги есть в библиотеке Ollama, что потянет ноутбук и как проверить, что отвечает именно Llama, а не другая модель.

Какую Llama брать

В библиотеке Ollama семейство разъехалось на несколько карточек. Путаница обычно здесь:

  • llama3.2 — маленькие 1B и 3B. Для ноутбука и проверки, что вообще всё работает.
  • llama3.1 — 8B, 70B и 405B. 8B — разумный старт, если есть 16 ГБ RAM.
  • llama3.3 — 70B, которая по заявке Meta близка к старой 405B.
  • llama4 — более новая мультимодальная линейка, тяжелее и не про «поставить за пять минут на восемь гигабайт».

Для первого запуска хватит 8B:

bash
ollama run llama3.1:8b

Если ноутбук слабый — ещё меньше:

bash
ollama run llama3.2

Первый вызов качает гигабайты. Повторный открывает чат сразу. Выйти из чата — /bye или Ctrl+D.

Скачать без чата:

bash
ollama pull llama3.1:8b
ollama list

В list должна появиться строка с именем модели и размером на диске. Если её нет — pull не докачал.

Как понять, что это сработало

После ollama run llama3.1:8b задайте вопрос, на который облачный ChatGPT ответил бы иначе:

plain
Напиши, какая ты модель и где сейчас крутишься — локально или в облаке.

Llama через Ollama работает на 127.0.0.1. Если в ответе «я ChatGPT / я в облаке OpenAI» — вы запустили не ту программу.

Проверка через API, тем же портом, что поднимает Ollama:

bash
curl http://127.0.0.1:11434/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Ответь одним словом: ping",
  "stream": false
}'

В JSON должно быть поле response. Ошибка model not found значит, что тег другой: смотрите ollama list.

Память и диск — без розовых цифр

Цифры плавают из-за квантования, но порядок такой:

  • Llama 3.2 1B/3B — ноутбук с 8 ГБ RAM, диск считайте гигабайтами, не десятками.
  • Llama 3.1 8B — комфортно от 16 ГБ RAM; на 8 ГБ уже впритык.
  • 70B (llama3.1:70b, llama3.3:70b) — это не «ещё одна кнопка», а десятки гигабайт. Без GPU будет мучительно медленно.

Не ставьте 70B «на всякий случай»: Ollama спокойно забьёт диск, а Windows начнёт свопить.

Лицензия Meta Llama — не MIT. Для многих сценариев её можно использовать, но это отдельная Community License, не «делай что хочешь». Перед коммерческим встраиванием прочитайте карточку модели, не этот абзац.

VS Code и «просто чат»

Чтобы Llama жила внутри редактора, Ollama всё равно должна быть запущена. Дальше — любой клиент, который умеет OpenAI-совместимый эндпоинт на порту 11434: Continue, Open WebUI, Copilot-подобные плагины с Custom Model.

Не ищите отдельный «Llama for VS Code» как замену Ollama. Редактор только подключается к уже скачанным весам.

Частые ошибки

  • Поставили Ollama и ждёте Llama. Пока нет ollama pull / ollama run с тегом llama…, весов нет.
  • Скачали llama2 по старой статье. Это предыдущее поколение. Для старта в 2026 берите llama3.2 или llama3.1:8b.
  • Перепутали с локальным Qwen или с облачным ChatGPT. Имя в ollama list должно начинаться с llama.
  • Запустили 70B на офисном ноутбуке и решили, что «Llama тормозит». Тормозит железо.

FAQ

Llama и Ollama — это одно и то же?

Нет. Llama — модель Meta. Ollama — программа, которая её запускает. Через Ollama же ставят Qwen, Gemma, DeepSeek.

Какая команда правильная: llama3, llama3.1 или llama3.2?

Для проверки установки — ollama run llama3.2. Для нормальной 8B-модели — ollama run llama3.1:8b. Голый llama3 — более старая карточка.

Нужна ли видеокарта?

Для 1B–8B нет. Для 70B — очень желательна.

Работает ли без интернета?

После того как веса скачались — да. Интернет нужен на pull.

Можно ли несколько Llama сразу?

На диске — да, ollama pull сколько влезет. В RAM одновременно обычно живёт одна загруженная модель.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

Как запустить Llama локально через Ollama — PLai