Google выпустила Gemini 3.8 Flash — быструю и дешёвую модель с настраиваемой глубиной рассуждений. Саймон Уиллисон уже добавил её в плагин llm-gemini 0.34, и теперь её можно вызывать прямо из терминала.
Зачем вообще нужен llm-gemini
llm — это CLI-инструмент Саймона Уиллисона для работы с языковыми моделями из командной строки. Плагин llm-gemini добавляет к нему поддержку моделей Google. Такая связка удобна, если вы встраиваете вызовы LLM в скрипты, пайплайны или просто хотите быстро проверить модель без возни с API-клиентом.
Gemini 3.8 Flash интересна конкретным сочетанием: скорость, низкая цена и три уровня «thinking» — то есть глубины внутренних рассуждений перед ответом. Это влияет и на качество вывода, и на стоимость запроса.
Установка и обновление плагина
Если llm уже стоит, достаточно обновить плагин:
llm install -U llm-geminiЕсли llm ещё нет, сначала ставим его:
pip install llm
llm install llm-geminiПроверяем, что версия правильная:
llm plugins | grep geminiДолжно вернуть llm-gemini версии 0.34 или выше.
Далее нужен API-ключ Google. Получить его можно в Google AI Studio. Прописываем в llm:
llm keys set geminiКак вызвать Gemini 3.8 Flash
Базовый вызов выглядит так:
llm -m gemini-3.8-flash "объясни разницу между TCP и UDP за три предложения"По умолчанию модель работает без явного thinking-уровня. Чтобы задать уровень, используем параметр -o thinking:
# Низкий уровень — быстрее и дешевле
llm -m gemini-3.8-flash -o thinking low "напиши функцию на Python для парсинга CSV"
# Средний уровень — баланс скорости и качества
llm -m gemini-3.8-flash -o thinking medium "спроектируй схему базы данных для интернет-магазина"
# Высокий уровень — максимальная глубина рассуждений
llm -m gemini-3.8-flash -o thinking high "найди уязвимости в этом коде: ..."Разница между уровнями — не маркетинг. На high модель тратит больше токенов на внутренние рассуждения, что повышает качество на сложных задачах, но увеличивает время ответа и стоимость.
Что умеет модель на практике
Саймон Уиллисон проверил Gemini 3.8 Flash простым промптом: «сделай мне что-нибудь крутое на HTML». Модель вернула работающий интерактивный демо за 13 секунд, стоимость запроса — 1,8 цента (около 1,6 рубля по текущему курсу, если считать в долях).
Это хорошо иллюстрирует нишу модели: задачи, где нужен быстрый, дешёвый и достаточно качественный вывод — генерация HTML, JavaScript, шаблонный код, объяснения, рефакторинг небольших функций.
Для сравнения: Gemini 3.7 Flash на тех же задачах работает медленнее и уступает по качеству HTML-вывода. Версия Gemini 3.8 Flash Cyber существует, но доступна только «доверенным защитникам» (trusted defenders) — это закрытый круг партнёров Google по кибербезопасности.
Исправление в 0.34: асинхронные запросы
Помимо новой модели, в релизе закрыт баг: асинхронные ответы не записывали итоговую версию модели в лог. Это важно, если вы используете llm для аудита или воспроизводимости экспериментов — теперь llm logs корректно показывает, какая именно версия модели ответила.
Проверить логи можно командой:
llm logs -n 5Где ломается
Gemini 3.8 Flash Cyber недоступна. Если вы попробуете вызвать модель gemini-3.8-flash-cyber, получите ошибку доступа — она закрыта для широкой аудитории.
Thinking-уровни не бесплатны. Уровень high заметно дороже low. Для массовых запросов в пайплайне это может неприятно сказаться на счёте — считайте токены заранее.
Async и версионирование. Баг с async был в версиях до 0.34. Если у вас в логах пустые поля model_version — обновитесь.
Ключ нужно обновить. Если плагин уже был установлен со старым ключом, иногда требуется переустановить его через llm keys set gemini.
Что попробовать дальше
Уиллисон использовал Gemini 3.8 Flash вместе со своим плагином llm-coding-agent — минималистичным агентом для написания кода. Связка позволила добавить поддержку HTML-блоков в его инструмент markdown-svg-renderer (рендерит SVG и HTML прямо из Markdown-файлов через Gist). Если вы строите похожие инструменты поверх llm, это рабочий пример агентного паттерна без лишних зависимостей.
FAQ
Чем Gemini 3.8 Flash отличается от 3.7 Flash?
Gemini 3.8 Flash быстрее, поддерживает три уровня thinking (low / medium / high) и показывает лучшее качество на задачах с HTML и JavaScript по сравнению с 3.7 Flash.
Как выбрать уровень thinking?
Используйте -o thinking low для простых задач и быстрых скриптов, medium — для большинства рабочих сценариев, high — для сложного кода, архитектурных вопросов или анализа уязвимостей.
Можно ли использовать llm-gemini без CLI, в Python-скриптах?
Да. llm предоставляет Python API. Подключите модель через llm.get_model("gemini-3.8-flash") и вызывайте .prompt() с нужными параметрами.
Что делать, если async-запросы не пишут версию модели в лог?
Обновите плагин до версии 0.34 командой llm install -U llm-gemini — баг исправлен именно в этом релизе.
Gemini 3.8 Flash Cyber — когда станет доступна всем?
Google не объявляла публичных сроков. Пока модель закрыта для «доверенных защитников» — партнёров в области кибербезопасности.


