# llm-gemini 0.34: подключаем Gemini 3.8 Flash с тремя уровнями «мышления» за 13 секунд
Каноническая страница: https://plainews.ru/posts/llm-gemini-034-gemini-38-flash-thinking
Опубликовано: 2026-09-03T11:01:05.210Z

Вышел llm-gemini 0.34 с поддержкой Gemini 3.8 Flash и тремя уровнями thinking. Показываем, как установить, настроить и выбрать нужный уровень.
Google выпустила Gemini 3.8 Flash — быструю и дешёвую модель с настраиваемой глубиной рассуждений. Саймон Уиллисон уже добавил её в плагин llm-gemini 0.34, и теперь её можно вызывать прямо из терминала.

## Зачем вообще нужен llm-gemini

llm — это CLI-инструмент Саймона Уиллисона для работы с языковыми моделями из командной строки. Плагин llm-gemini добавляет к нему поддержку моделей Google. Такая связка удобна, если вы встраиваете вызовы LLM в скрипты, пайплайны или просто хотите быстро проверить модель без возни с API-клиентом.

Gemini 3.8 Flash интересна конкретным сочетанием: скорость, низкая цена и три уровня «thinking» — то есть глубины внутренних рассуждений перед ответом. Это влияет и на качество вывода, и на стоимость запроса.

## Установка и обновление плагина

Если llm уже стоит, достаточно обновить плагин:

```bash
llm install -U llm-gemini
```

Если llm ещё нет, сначала ставим его:

```bash
pip install llm
llm install llm-gemini
```

Проверяем, что версия правильная:

```bash
llm plugins | grep gemini
```

Должно вернуть llm-gemini версии 0.34 или выше.

Далее нужен API-ключ Google. Получить его можно в Google AI Studio. Прописываем в llm:

```bash
llm keys set gemini
```

## Как вызвать Gemini 3.8 Flash

Базовый вызов выглядит так:

```bash
llm -m gemini-3.8-flash "объясни разницу между TCP и UDP за три предложения"
```

По умолчанию модель работает без явного thinking-уровня. Чтобы задать уровень, используем параметр -o thinking:

```bash
# Низкий уровень — быстрее и дешевле
llm -m gemini-3.8-flash -o thinking low "напиши функцию на Python для парсинга CSV"

# Средний уровень — баланс скорости и качества
llm -m gemini-3.8-flash -o thinking medium "спроектируй схему базы данных для интернет-магазина"

# Высокий уровень — максимальная глубина рассуждений
llm -m gemini-3.8-flash -o thinking high "найди уязвимости в этом коде: ..."
```

Разница между уровнями — не маркетинг. На high модель тратит больше токенов на внутренние рассуждения, что повышает качество на сложных задачах, но увеличивает время ответа и стоимость.

## Что умеет модель на практике

Саймон Уиллисон проверил Gemini 3.8 Flash простым промптом: «сделай мне что-нибудь крутое на HTML». Модель вернула работающий интерактивный демо за 13 секунд, стоимость запроса — 1,8 цента (около 1,6 рубля по текущему курсу, если считать в долях).

Это хорошо иллюстрирует нишу модели: задачи, где нужен быстрый, дешёвый и достаточно качественный вывод — генерация HTML, JavaScript, шаблонный код, объяснения, рефакторинг небольших функций.

Для сравнения: Gemini 3.7 Flash на тех же задачах работает медленнее и уступает по качеству HTML-вывода. Версия Gemini 3.8 Flash Cyber существует, но доступна только «доверенным защитникам» (trusted defenders) — это закрытый круг партнёров Google по кибербезопасности.

## Исправление в 0.34: асинхронные запросы

Помимо новой модели, в релизе закрыт баг: асинхронные ответы не записывали итоговую версию модели в лог. Это важно, если вы используете llm для аудита или воспроизводимости экспериментов — теперь llm logs корректно показывает, какая именно версия модели ответила.

Проверить логи можно командой:

```bash
llm logs -n 5
```

## Где ломается

**Gemini 3.8 Flash Cyber недоступна.** Если вы попробуете вызвать модель gemini-3.8-flash-cyber, получите ошибку доступа — она закрыта для широкой аудитории.

**Thinking-уровни не бесплатны.** Уровень high заметно дороже low. Для массовых запросов в пайплайне это может неприятно сказаться на счёте — считайте токены заранее.

**Async и версионирование.** Баг с async был в версиях до 0.34. Если у вас в логах пустые поля model_version — обновитесь.

**Ключ нужно обновить.** Если плагин уже был установлен со старым ключом, иногда требуется переустановить его через llm keys set gemini.

## Что попробовать дальше

Уиллисон использовал Gemini 3.8 Flash вместе со своим плагином llm-coding-agent — минималистичным агентом для написания кода. Связка позволила добавить поддержку HTML-блоков в его инструмент markdown-svg-renderer (рендерит SVG и HTML прямо из Markdown-файлов через Gist). Если вы строите похожие инструменты поверх llm, это рабочий пример агентного паттерна без лишних зависимостей.

---

## FAQ

### Чем Gemini 3.8 Flash отличается от 3.7 Flash?

Gemini 3.8 Flash быстрее, поддерживает три уровня thinking (low / medium / high) и показывает лучшее качество на задачах с HTML и JavaScript по сравнению с 3.7 Flash.

### Как выбрать уровень thinking?

Используйте -o thinking low для простых задач и быстрых скриптов, medium — для большинства рабочих сценариев, high — для сложного кода, архитектурных вопросов или анализа уязвимостей.

### Можно ли использовать llm-gemini без CLI, в Python-скриптах?

Да. llm предоставляет Python API. Подключите модель через llm.get_model("gemini-3.8-flash") и вызывайте .prompt() с нужными параметрами.

### Что делать, если async-запросы не пишут версию модели в лог?

Обновите плагин до версии 0.34 командой llm install -U llm-gemini — баг исправлен именно в этом релизе.

### Gemini 3.8 Flash Cyber — когда станет доступна всем?

Google не объявляла публичных сроков. Пока модель закрыта для «доверенных защитников» — партнёров в области кибербезопасности.

## Источники

- Simon Willison: llm-gemini 0.34
