Google сделала Gemini дешевле на 65% — но не умнее. Когда это выгодно
Google выпустила Gemini 3.6 Flash — модель не умнее предшественницы, но тратит на 17-65% меньше токенов. Разбираем, где это реально экономит деньги и где модель проигрывает конкурентам.

21 июля вместо обещанного Gemini 3.5 Pro Google выкатила три модели уровня Flash. Флагмана ждали с мая — его перенесли уже третий раз. Зато то, что вышло, решает более практичную задачу: Gemini 3.6 Flash тратит на 17% меньше токенов на те же операции, а в сценариях с агентами — до 65% меньше. При этом общий индекс интеллекта не изменился: те же 50 баллов, что у предшественницы.
Разбираемся, почему экономия токенов важнее бенчмарков, где новая модель реально выигрывает (длинный контекст, управление компьютером), где откровенно сливает (чистый кодинг, научные задачи), и что это значит для агентных сценариев.
Что выпустили 21 июля
Google анонсировала сразу три модели:
- Gemini 3.6 Flash — основная рабочая модель, замена 3.5 Flash
- Gemini 3.5 Flash-Lite — самая быстрая и дешёвая в линейке
- Gemini 3.5 Flash Cyber — специализированная для поиска уязвимостей, доступна только правительствам и доверенным партнёрам
Параллельно компания сообщила, что тестирует Gemini 3.5 Pro с партнёрами и запустила «самый амбициозный претрейн» для Gemini 4. То есть следующий большой скачок будет нескоро, а пока Google закрывает вопрос со средним тиром.
Цены и доступ:
| Модель | Цена (вход / выход, $ за 1M токенов) | Доступ | |--------|---------------------------------------|---------| | Gemini 3.6 Flash | $1,50 / $7,50 | API, Gemini App | | Gemini 3.5 Flash-Lite | $0,30 / $2,50 | API, Google Поиск | | Gemini 3.5 Flash Cyber | Не раскрыта | Только госорганы |
Почему 17% экономии важнее интеллекта
Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем 3.5 Flash, при решении идентичных задач (данные Artificial Analysis). В отдельных сценариях, например в тесте DeepSWE на автономное исправление кода, экономия доходит до 65% — модель использует 97 тысяч токенов вместо 276 тысяч.
Общий индекс интеллекта остался на уровне 50 баллов. Модель не стала умнее — она стала экономнее и реже ходит кругами.
Для разового запроса в чат разница незаметна. Но для агента, который внутри одной задачи читает файлы, гуглит, вызывает инструменты и пишет ответ, каждый лишний шаг — это токены, а токены — это деньги.
Стоимость задачи — это произведение трёх переменных:
`` цена за токен × токенов на задачу × попыток до успеха ``
Google снизила первую переменную на ~17% (выход подешевел с $9 до $7,5 за миллион). Но вторая переменная упала как минимум настолько же. Перемножьте — для типового сценария получается ~31% дешевле за выполненную задачу, а для агентного кодинга (где токены раньше уходили в циклы «правка → тест → провал → снова правка») реальная экономия доходит до 65-71%.
При этом Google не урезала длину и качество ответов. Оценка на DeepSWE выросла с 37% до 49% параллельно с падением расхода токенов — редкое сочетание, обычно экономия и качество тянут в разные стороны.
Где 3.6 Flash выигрывает — и где сливает
| Бенчмарк | Что измеряет | Gemini 3.5 Flash | Gemini 3.6 Flash | |----------|--------------|-------------------|-------------------| | DeepSWE | Автономное исправление кода | 37% | 49% | | MLE-Bench | ML-исследования | 49,7% | 63,9% | | OSWorld-Verified | Управление компьютером | 78,4% | 83,0% | | GDPval-AA v2 | Реальные офисные задачи | 1349 Elo | 1421 Elo | | GDM-MRCR v2 (1M токенов) | Поиск в длинном контексте | ~27% | 54,0% |
Прирост по управлению компьютером и длинному контексту — самый серьёзный скачок в релизе. Модель находит нужный фрагмент в документе на миллион токенов вдвое надёжнее предшественницы. Учитывая, что окно контекста в 1 048 576 токенов давно продаётся как фича, а по факту у некоторых моделей «теряется» середина длинного документа, это тот случай, когда цифра важнее ценника.
Но в прямых боях с конкурентами картина другая:
- SWE-Bench Pro: 58,7% у Gemini 3.6 Flash против 64,7% у Grok 4.5 и 63,2% у Claude Sonnet 5
- DeepSWE: 49% против 67% у GPT-5.6 Luna
- GDPval-AA (знаниевые задачи): 1421 Elo против 1607 у Sonnet 5
Google уверенно держит лидерство в компьютерном управлении, работе с графиками и длинным контекстом — и заметно отстаёт в чистом кодинге и научных задачах от топовых моделей конкурентов.
Когда 3.6 Flash — правильный выбор
Это рабочая лошадка, а не чемпион. Если задача — сложная нетривиальная разработка с нуля, фронтир-модели (Claude 5, ChatGPT 5.6, Gemini 3.1 Pro) всё ещё впереди.
Если задача — прогнать много рутинных инструментально-насыщенных операций дёшево, 3.6 Flash сейчас одна из лучших сделок на рынке.
Сценарии, где экономия токенов работает как множитель:
- Агенты с циклами чтения файлов, поиска и правок
- RAG-системы с частыми обращениями к длинным документам
- Автоматизация офисных задач через управление компьютером
- Batch-обработка больших объёмов однотипных запросов
Где лучше взять фронтир-модель:
- Научные исследования с нетривиальной аналитикой
- Сложный кодинг с архитектурными решениями
- Задачи, где цена ошибки выше цены запроса
Подводные камни
Нет прямого сравнения скорости в официальных данных. Google говорит, что модель «вдвое быстрее решает многошаговые задачи», но не публикует latency в миллисекундах. Artificial Analysis показывает, что скорость генерации выросла, но не в два раза по времени отклика.
Третья переменная — «попыток до успеха» — нигде не публикуется. Модель, которая стабильно решает с первого раза по более высокой цене за токен, обычно выходит дешевле «дешёвой» модели, которой нужно три попытки. Проверить это можно только на своих задачах.
Gemini 3.5 Pro всё ещё в тестировании. Если ждали флагман для сложных задач — ждать придётся ещё. Google тестирует его с партнёрами, но публичного релиза нет.
Что попробовать дальше
Если используете Gemini 3.5 Flash в production, переход на 3.6 Flash — очевидный шаг. API-ключ тот же, интеграция не меняется, цена ниже, токенов меньше.
Если выбираете модель для агента с инструментами — протестируйте 3.6 Flash на своих задачах и сравните не только цену за токен, но и общее количество токенов на выполненную задачу.
Если нужен максимум интеллекта для разовых сложных операций — смотрите в сторону Claude 5 или GPT-5.6. Если нужна скорость и дешевизна для потоковых задач — Flash-Lite стоит $0,30 за миллион входных токенов.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

