# Google сделала Gemini дешевле на 65% — но не умнее. Когда это выгодно
Каноническая страница: https://plainews.ru/posts/gemini-3-6-flash-ekonomiya-tokenov
Опубликовано: 2026-07-26T07:00:56.894Z

Google выпустила Gemini 3.6 Flash — модель не умнее предшественницы, но тратит на 17-65% меньше токенов. Разбираем, где это реально экономит деньги и где модель проигрывает конкурентам.
21 июля вместо обещанного Gemini 3.5 Pro Google выкатила три модели уровня Flash. Флагмана ждали с мая — его перенесли уже третий раз. Зато то, что вышло, решает более практичную задачу: Gemini 3.6 Flash тратит на 17% меньше токенов на те же операции, а в сценариях с агентами — до 65% меньше. При этом общий индекс интеллекта не изменился: те же 50 баллов, что у предшественницы.

Разбираемся, почему экономия токенов важнее бенчмарков, где новая модель реально выигрывает (длинный контекст, управление компьютером), где откровенно сливает (чистый кодинг, научные задачи), и что это значит для агентных сценариев.

## Что выпустили 21 июля

Google анонсировала сразу три модели:

- **Gemini 3.6 Flash** — основная рабочая модель, замена 3.5 Flash
- **Gemini 3.5 Flash-Lite** — самая быстрая и дешёвая в линейке
- **Gemini 3.5 Flash Cyber** — специализированная для поиска уязвимостей, доступна только правительствам и доверенным партнёрам

Параллельно компания сообщила, что тестирует Gemini 3.5 Pro с партнёрами и запустила «самый амбициозный претрейн» для Gemini 4. То есть следующий большой скачок будет нескоро, а пока Google закрывает вопрос со средним тиром.

**Цены и доступ:**

| Модель | Цена (вход / выход, $ за 1M токенов) | Доступ | |--------|---------------------------------------|---------| | Gemini 3.6 Flash | $1,50 / $7,50 | API, Gemini App | | Gemini 3.5 Flash-Lite | $0,30 / $2,50 | API, Google Поиск | | Gemini 3.5 Flash Cyber | Не раскрыта | Только госорганы |

## Почему 17% экономии важнее интеллекта

Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем 3.5 Flash, при решении идентичных задач (данные Artificial Analysis). В отдельных сценариях, например в тесте DeepSWE на автономное исправление кода, экономия доходит до 65% — модель использует 97 тысяч токенов вместо 276 тысяч.

Общий индекс интеллекта остался на уровне 50 баллов. Модель не стала умнее — она стала экономнее и реже ходит кругами.

Для разового запроса в чат разница незаметна. Но для агента, который внутри одной задачи читает файлы, гуглит, вызывает инструменты и пишет ответ, каждый лишний шаг — это токены, а токены — это деньги.

**Стоимость задачи — это произведение трёх переменных:**

`` цена за токен × токенов на задачу × попыток до успеха ``

Google снизила первую переменную на ~17% (выход подешевел с $9 до $7,5 за миллион). Но вторая переменная упала как минимум настолько же. Перемножьте — для типового сценария получается ~31% дешевле за выполненную задачу, а для агентного кодинга (где токены раньше уходили в циклы «правка → тест → провал → снова правка») реальная экономия доходит до 65-71%.

При этом Google не урезала длину и качество ответов. Оценка на DeepSWE выросла с 37% до 49% параллельно с падением расхода токенов — редкое сочетание, обычно экономия и качество тянут в разные стороны.

## Где 3.6 Flash выигрывает — и где сливает

| Бенчмарк | Что измеряет | Gemini 3.5 Flash | Gemini 3.6 Flash | |----------|--------------|-------------------|-------------------| | DeepSWE | Автономное исправление кода | 37% | 49% | | MLE-Bench | ML-исследования | 49,7% | 63,9% | | OSWorld-Verified | Управление компьютером | 78,4% | 83,0% | | GDPval-AA v2 | Реальные офисные задачи | 1349 Elo | 1421 Elo | | GDM-MRCR v2 (1M токенов) | Поиск в длинном контексте | ~27% | 54,0% |

Прирост по управлению компьютером и длинному контексту — самый серьёзный скачок в релизе. Модель находит нужный фрагмент в документе на миллион токенов вдвое надёжнее предшественницы. Учитывая, что окно контекста в 1 048 576 токенов давно продаётся как фича, а по факту у некоторых моделей «теряется» середина длинного документа, это тот случай, когда цифра важнее ценника.

**Но в прямых боях с конкурентами картина другая:**

- **SWE-Bench Pro:** 58,7% у Gemini 3.6 Flash против 64,7% у Grok 4.5 и 63,2% у Claude Sonnet 5
- **DeepSWE:** 49% против 67% у GPT-5.6 Luna
- **GDPval-AA (знаниевые задачи):** 1421 Elo против 1607 у Sonnet 5

Google уверенно держит лидерство в компьютерном управлении, работе с графиками и длинным контекстом — и заметно отстаёт в чистом кодинге и научных задачах от топовых моделей конкурентов.

## Когда 3.6 Flash — правильный выбор

Это рабочая лошадка, а не чемпион. Если задача — сложная нетривиальная разработка с нуля, фронтир-модели (Claude 5, ChatGPT 5.6, Gemini 3.1 Pro) всё ещё впереди.

Если задача — прогнать много рутинных инструментально-насыщенных операций дёшево, 3.6 Flash сейчас одна из лучших сделок на рынке.

**Сценарии, где экономия токенов работает как множитель:**

- Агенты с циклами чтения файлов, поиска и правок
- RAG-системы с частыми обращениями к длинным документам
- Автоматизация офисных задач через управление компьютером
- Batch-обработка больших объёмов однотипных запросов

**Где лучше взять фронтир-модель:**

- Научные исследования с нетривиальной аналитикой
- Сложный кодинг с архитектурными решениями
- Задачи, где цена ошибки выше цены запроса

## Подводные камни

**Нет прямого сравнения скорости в официальных данных.** Google говорит, что модель «вдвое быстрее решает многошаговые задачи», но не публикует latency в миллисекундах. Artificial Analysis показывает, что скорость генерации выросла, но не в два раза по времени отклика.

**Третья переменная — «попыток до успеха» — нигде не публикуется.** Модель, которая стабильно решает с первого раза по более высокой цене за токен, обычно выходит дешевле «дешёвой» модели, которой нужно три попытки. Проверить это можно только на своих задачах.

**Gemini 3.5 Pro всё ещё в тестировании.** Если ждали флагман для сложных задач — ждать придётся ещё. Google тестирует его с партнёрами, но публичного релиза нет.

## Что попробовать дальше

Если используете Gemini 3.5 Flash в production, переход на 3.6 Flash — очевидный шаг. API-ключ тот же, интеграция не меняется, цена ниже, токенов меньше.

Если выбираете модель для агента с инструментами — протестируйте 3.6 Flash на своих задачах и сравните не только цену за токен, но и общее количество токенов на выполненную задачу.

Если нужен максимум интеллекта для разовых сложных операций — смотрите в сторону Claude 5 или GPT-5.6. Если нужна скорость и дешевизна для потоковых задач — Flash-Lite стоит $0,30 за миллион входных токенов.

## Источники

- Habr AI: Gemini 3.6 Flash: модель не стала умнее, но стала гениально дешёвой
