# LLM 0.32rc2: как запускать промпты на любом OpenAI-совместимом API без настройки модели
Каноническая страница: https://plainews.ru/posts/llm-032rc2-openai-endpoint-command
Опубликовано: 2026-07-31T07:00:57.929Z

Саймон Виллисон добавил в свой CLI-инструмент команду для тестирования любых OpenAI-совместимых эндпоинтов без конфигов. Разбираем новую версию и смену дефолтной модели.
Саймон Виллисон выпустил вторую release candidate версию своего CLI-инструмента LLM — 0.32rc2. Главное изменение: теперь можно стучаться к любому эндпоинту, совместимому с OpenAI Chat Completions API, одной командой — без предварительной настройки моделей и без логирования. Плюс дефолтная модель сменилась с GPT-4o mini на более свежую и дорогую GPT-5.6 Luna.

## Зачем нужна команда openai endpoint

Если вы разворачиваете локальные модели (LM Studio, vLLM, Ollama с OpenAI-совместимым API) или пробуете сторонние провайдеры, обычно приходится либо писать curl-запросы вручную, либо настраивать клиент. Саймон столкнулся с тем, что нормального CLI для быстрой проверки произвольных эндпоинтов нет, и встроил эту возможность прямо в LLM.

Теперь можно бросить промпт на любой совместимый сервер за одну команду — даже без установки LLM на машину, через uvx.

## Как это работает: однострочник с uvx

Запустить промпт на локальной модели в LM Studio (или любом другом сервере с OpenAI-совместимым API):

``bash uvx --pre llm openai endpoint http://127.0.0.1:1234/v1 \   -T llm_version -T llm_time --td \   -m google/gemma-4-31b 'what is the current LLM version? And the time?' ``

Разберём флаги:

- uvx --pre llm — запускает pre-release версию LLM через uv без установки в систему
- openai endpoint <URL> — указывает адрес эндпоинта (здесь локальный LM Studio на порту 1234)
- -T llm_version -T llm_time — подключает инструменты (tools) для вызова функций
- --td — включает трассировку вызовов инструментов (tool debugging)
- -m google/gemma-4-31b — имя модели, которое понимает ваш сервер
- Последний аргумент — сам промпт

Результат выполнится мгновенно, без записи в локальную базу логов LLM. Это удобно для экспериментов, когда не хочется захламлять историю.

## Смена дефолтной модели: GPT-5.6 Luna вместо 4o mini

Для тех, кто не задал свою дефолтную модель явно, LLM теперь использует **GPT-5.6 Luna** вместо прежней GPT-4o mini. Luna свежее и сильнее, но дороже:

- **GPT-5.6 Luna**: $0.20 за миллион входных токенов, $1.20 за миллион выходных
- **GPT-4o mini**: $0.15 / $0.60

Если вам важнее цена, можно откатиться обратно:

``bash llm models default gpt-4o-mini ``

Или выбрать ещё более дешёвую **GPT-5 nano** ($0.05 / $0.40):

``bash llm models default gpt-5-nano ``

Изменение касается только тех, кто установит 0.32rc2 и не настроил дефолт вручную. Если вы уже зафиксировали модель командой llm models default, ничего не поменяется.

## Где это пригодится

**Тестирование локальных моделей.** Развернули модель через LM Studio, Ollama или vLLM с OpenAI-совместимым интерфейсом — можно сразу проверить работу без написания скриптов.

**Проверка сторонних провайдеров.** Если провайдер заявляет совместимость с OpenAI API (многие inference-платформы так делают), можно быстро убедиться, что всё работает.

**Отладка без логов.** Вызовы через openai endpoint не попадают в базу LLM. Это полезно, если не хотите засорять историю тестовыми запросами или работаете с чувствительными данными.

## Подводные камни

**Формат имён моделей.** У каждого провайдера свои правила: LM Studio может ожидать google/gemma-4-31b, Ollama — просто gemma, vLLM — полный путь с хабом. Придётся подсмотреть в документации сервера.

**Поддержка tools.** Не все эндпоинты умеют в function calling. Если флаг -T вызовет ошибку, значит, сервер не реализует эту часть спецификации.

**Аутентификация.** Команда не документирует явной передачи API-ключей. Если эндпоинт требует токен, возможно, придётся использовать стандартные переменные окружения (OPENAI_API_KEY) или прокси.

## Что попробовать дальше

Если вам зашёл подход «один CLI для всех моделей», посмотрите на:

- **vLLM** с флагом --api-key и --host — разворачивает OpenAI-совместимый сервер для любой модели из Hugging Face
- **Ollama** с OLLAMA_ORIGINS и переменной OLLAMA_HOST — поддерживает OpenAI API начиная с версии 0.1.14
- **LiteLLM** — прокси-слой, который приводит API разных провайдеров (Anthropic, Cohere, Azure) к единому OpenAI-формату

Команда llm openai endpoint превращает LLM в универсальный клиент для любого совместимого сервера. Если вы часто переключаетесь между локальными моделями и облачными провайдерами, это сильно ускоряет рабочий процесс.

## Источники

- Simon Willison: llm 0.32rc2
