← На главную
Гайды· 31.07.2026· 3 мин чтения

LLM 0.32rc2: как запускать промпты на любом OpenAI-совместимом API без настройки модели

Саймон Виллисон добавил в свой CLI-инструмент команду для тестирования любых OpenAI-совместимых эндпоинтов без конфигов. Разбираем новую версию и смену дефолтной модели.

LLM 0.32rc2: как запускать промпты на любом OpenAI-совместимом API без настройки модели
Материал подготовлен с помощью ИИ и проверен редактором

Саймон Виллисон выпустил вторую release candidate версию своего CLI-инструмента LLM — 0.32rc2. Главное изменение: теперь можно стучаться к любому эндпоинту, совместимому с OpenAI Chat Completions API, одной командой — без предварительной настройки моделей и без логирования. Плюс дефолтная модель сменилась с GPT-4o mini на более свежую и дорогую GPT-5.6 Luna.

Зачем нужна команда openai endpoint

Если вы разворачиваете локальные модели (LM Studio, vLLM, Ollama с OpenAI-совместимым API) или пробуете сторонние провайдеры, обычно приходится либо писать curl-запросы вручную, либо настраивать клиент. Саймон столкнулся с тем, что нормального CLI для быстрой проверки произвольных эндпоинтов нет, и встроил эту возможность прямо в LLM.

Теперь можно бросить промпт на любой совместимый сервер за одну команду — даже без установки LLM на машину, через uvx.

Как это работает: однострочник с uvx

Запустить промпт на локальной модели в LM Studio (или любом другом сервере с OpenAI-совместимым API):

``bash uvx --pre llm openai endpoint http://127.0.0.1:1234/v1 \ -T llm_version -T llm_time --td \ -m google/gemma-4-31b 'what is the current LLM version? And the time?' ``

Разберём флаги:

  • uvx --pre llm — запускает pre-release версию LLM через uv без установки в систему
  • openai endpoint <URL> — указывает адрес эндпоинта (здесь локальный LM Studio на порту 1234)
  • -T llm_version -T llm_time — подключает инструменты (tools) для вызова функций
  • --td — включает трассировку вызовов инструментов (tool debugging)
  • -m google/gemma-4-31b — имя модели, которое понимает ваш сервер
  • Последний аргумент — сам промпт

Результат выполнится мгновенно, без записи в локальную базу логов LLM. Это удобно для экспериментов, когда не хочется захламлять историю.

Смена дефолтной модели: GPT-5.6 Luna вместо 4o mini

Для тех, кто не задал свою дефолтную модель явно, LLM теперь использует GPT-5.6 Luna вместо прежней GPT-4o mini. Luna свежее и сильнее, но дороже:

  • GPT-5.6 Luna: $0.20 за миллион входных токенов, $1.20 за миллион выходных
  • GPT-4o mini: $0.15 / $0.60

Если вам важнее цена, можно откатиться обратно:

``bash llm models default gpt-4o-mini ``

Или выбрать ещё более дешёвую GPT-5 nano ($0.05 / $0.40):

``bash llm models default gpt-5-nano ``

Изменение касается только тех, кто установит 0.32rc2 и не настроил дефолт вручную. Если вы уже зафиксировали модель командой llm models default, ничего не поменяется.

Где это пригодится

Тестирование локальных моделей. Развернули модель через LM Studio, Ollama или vLLM с OpenAI-совместимым интерфейсом — можно сразу проверить работу без написания скриптов.

Проверка сторонних провайдеров. Если провайдер заявляет совместимость с OpenAI API (многие inference-платформы так делают), можно быстро убедиться, что всё работает.

Отладка без логов. Вызовы через openai endpoint не попадают в базу LLM. Это полезно, если не хотите засорять историю тестовыми запросами или работаете с чувствительными данными.

Подводные камни

Формат имён моделей. У каждого провайдера свои правила: LM Studio может ожидать google/gemma-4-31b, Ollama — просто gemma, vLLM — полный путь с хабом. Придётся подсмотреть в документации сервера.

Поддержка tools. Не все эндпоинты умеют в function calling. Если флаг -T вызовет ошибку, значит, сервер не реализует эту часть спецификации.

Аутентификация. Команда не документирует явной передачи API-ключей. Если эндпоинт требует токен, возможно, придётся использовать стандартные переменные окружения (OPENAI_API_KEY) или прокси.

Что попробовать дальше

Если вам зашёл подход «один CLI для всех моделей», посмотрите на:

  • vLLM с флагом --api-key и --host — разворачивает OpenAI-совместимый сервер для любой модели из Hugging Face
  • Ollama с OLLAMA_ORIGINS и переменной OLLAMA_HOST — поддерживает OpenAI API начиная с версии 0.1.14
  • LiteLLM — прокси-слой, который приводит API разных провайдеров (Anthropic, Cohere, Azure) к единому OpenAI-формату

Команда llm openai endpoint превращает LLM в универсальный клиент для любого совместимого сервера. Если вы часто переключаетесь между локальными моделями и облачными провайдерами, это сильно ускоряет рабочий процесс.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

LLM 0.32rc2: как запускать промпты на любом API без настройки — PLai