Как запустить Llama локально через Ollama: 8B, 70B и что потянет ПК
Llama — это веса Meta, не программа. Какие теги брать в Ollama, чем 3.2 отличается от 3.1 и почему 70B на ноутбуке — плохая идея.

Llama — это семейство моделей Meta, а не программа. Ставить «Llama.exe» не нужно: веса качает рантайм. Самый короткий путь на своём компьютере — Ollama. Если её ещё нет, сначала поставьте рантайм по гайду как установить Ollama, затем вернитесь сюда и скачайте конкретную Llama.
Ниже — какие теги есть в библиотеке Ollama, что потянет ноутбук и как проверить, что отвечает именно Llama, а не другая модель.
Какую Llama брать
В библиотеке Ollama семейство разъехалось на несколько карточек. Путаница обычно здесь:
llama3.2— маленькие 1B и 3B. Для ноутбука и проверки, что вообще всё работает.llama3.1— 8B, 70B и 405B. 8B — разумный старт, если есть 16 ГБ RAM.llama3.3— 70B, которая по заявке Meta близка к старой 405B.llama4— более новая мультимодальная линейка, тяжелее и не про «поставить за пять минут на восемь гигабайт».
Для первого запуска хватит 8B:
ollama run llama3.1:8bЕсли ноутбук слабый — ещё меньше:
ollama run llama3.2Первый вызов качает гигабайты. Повторный открывает чат сразу. Выйти из чата — /bye или Ctrl+D.
Скачать без чата:
ollama pull llama3.1:8b
ollama listВ list должна появиться строка с именем модели и размером на диске. Если её нет — pull не докачал.
Как понять, что это сработало
После ollama run llama3.1:8b задайте вопрос, на который облачный ChatGPT ответил бы иначе:
Напиши, какая ты модель и где сейчас крутишься — локально или в облаке.Llama через Ollama работает на 127.0.0.1. Если в ответе «я ChatGPT / я в облаке OpenAI» — вы запустили не ту программу.
Проверка через API, тем же портом, что поднимает Ollama:
curl http://127.0.0.1:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Ответь одним словом: ping",
"stream": false
}'В JSON должно быть поле response. Ошибка model not found значит, что тег другой: смотрите ollama list.
Память и диск — без розовых цифр
Цифры плавают из-за квантования, но порядок такой:
- Llama 3.2 1B/3B — ноутбук с 8 ГБ RAM, диск считайте гигабайтами, не десятками.
- Llama 3.1 8B — комфортно от 16 ГБ RAM; на 8 ГБ уже впритык.
- 70B (
llama3.1:70b,llama3.3:70b) — это не «ещё одна кнопка», а десятки гигабайт. Без GPU будет мучительно медленно.
Не ставьте 70B «на всякий случай»: Ollama спокойно забьёт диск, а Windows начнёт свопить.
Лицензия Meta Llama — не MIT. Для многих сценариев её можно использовать, но это отдельная Community License, не «делай что хочешь». Перед коммерческим встраиванием прочитайте карточку модели, не этот абзац.
VS Code и «просто чат»
Чтобы Llama жила внутри редактора, Ollama всё равно должна быть запущена. Дальше — любой клиент, который умеет OpenAI-совместимый эндпоинт на порту 11434: Continue, Open WebUI, Copilot-подобные плагины с Custom Model.
Не ищите отдельный «Llama for VS Code» как замену Ollama. Редактор только подключается к уже скачанным весам.
Частые ошибки
- Поставили Ollama и ждёте Llama. Пока нет
ollama pull/ollama runс тегомllama…, весов нет. - Скачали
llama2по старой статье. Это предыдущее поколение. Для старта в 2026 беритеllama3.2илиllama3.1:8b. - Перепутали с локальным Qwen или с облачным ChatGPT. Имя в
ollama listдолжно начинаться сllama. - Запустили 70B на офисном ноутбуке и решили, что «Llama тормозит». Тормозит железо.
FAQ
Llama и Ollama — это одно и то же?
Нет. Llama — модель Meta. Ollama — программа, которая её запускает. Через Ollama же ставят Qwen, Gemma, DeepSeek.
Какая команда правильная: llama3, llama3.1 или llama3.2?
Для проверки установки — ollama run llama3.2. Для нормальной 8B-модели — ollama run llama3.1:8b. Голый llama3 — более старая карточка.
Нужна ли видеокарта?
Для 1B–8B нет. Для 70B — очень желательна.
Работает ли без интернета?
После того как веса скачались — да. Интернет нужен на pull.
Можно ли несколько Llama сразу?
На диске — да, ollama pull сколько влезет. В RAM одновременно обычно живёт одна загруженная модель.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


