xAI Илона Маска выпустила Grok 4.7 — по заявлению компании, самую способную модель в линейке для кода и работы со знаниями. Цена выглядит агрессивно: $2 за миллион входящих токенов и $6 за исходящие. Но независимые бенчмарки сразу расставили всё по местам.
Что внутри новой модели
xAI описывает Grok 4.7 тремя тезисами: более крупная базовая модель, более длинное обучение с подкреплением (reinforcement learning — метод, при котором модель учится на собственных ошибках через систему наград) и улучшенная верификация собственных ответов. Конкретных архитектурных деталей — размера модели, количества параметров, данных для обучения — компания не раскрыла.
Доступна модель через три канала: Grok API, редактор кода Cursor и платформу Grok Build.
Цифры, которые объясняют цену
На независимом Artificial Analysis Intelligence Index версии 4.3.2, агрегирующем десять разных бенчмарков, Grok 4.7 набирает 46 баллов. Claude Fable 5.1 и GPT-6 — по 53 каждый. Разрыв в 7 баллов на интегральном индексе — это уже не погрешность.
В агентном кодировании (задачи, где модель самостоятельно пишет, запускает и правит код в терминале) картина хуже. На Terminal-Bench 4.0:
| Модель | Terminal-Bench 4.0 |
|---|---|
| GPT-6 Astra | 60% |
| Claude Fable 5.1 | 55% |
| DeepSeek V4.1 Flash | 27% |
| Grok 4.7 | 26% |
Grok 4.7 не просто отстаёт от лидеров вдвое — его обходит даже более дешёвый DeepSeek V4.1 Flash с результатом 27%. Один процентный пункт разницы при таком отставании от топа — это статистический шум, а не конкурентное преимущество.
Отдельно в источнике отмечается: два высших уровня рассуждения у Grok 4.7 показывают примерно одинаковые результаты. Это косвенно говорит о том, что модель не масштабируется на самых сложных задачах так, как ожидалось от более крупной базы.
Кому это реально нужно
Ценовое позиционирование — $2/$6 за миллион токенов — действительно ближе к китайским моделям, чем к западным фронтирным. Для сравнения: GPT-6 и Claude Fable 5.1 стоят существенно дороже (конкретные цифры в источнике не приводятся, но разрыв xAI называет принципиальным).
Это делает Grok 4.7 потенциально интересным в нескольких сценариях:
Высокий объём, низкая сложность. Если задача — классификация, суммаризация или генерация шаблонного текста в масштабе миллиардов токенов в месяц, разрыв в качестве может не иметь значения, а экономия — иметь.
Эксперименты и прототипирование. Cursor уже интегрирован — разработчик может попробовать модель без дополнительной настройки. Для быстрой проверки гипотезы цена входа низкая.
Не агентные задачи. Результат 26% на Terminal-Bench 4.0 означает, что доверять Grok 4.7 автономную работу в терминале — плохая идея. Для разовых запросов и помощи с кодом внутри чата ситуация может быть лучше, но бенчмарк это не измеряет.
Где это ломается и чего в релизе нет
Главная проблема — агентное кодирование сейчас является одним из ключевых сценариев для моделей такого класса. Именно туда идут деньги корпоративных покупателей: автономные агенты, CI/CD-интеграции, рефакторинг больших кодовых баз. Результат 26% на Terminal-Bench 4.0 закрывает этот рынок для Grok 4.7 на текущем этапе.
xAI не опубликовала собственные бенчмарки, методологию обучения или сравнительные таблицы — только словесные тезисы про «более крупную базу» и «более длинное RL». Это стандартная практика для релизов, где цифры не работают в пользу компании.
Также неизвестно: есть ли у Grok 4.7 контекстное окно большего размера по сравнению с предыдущими версиями, какова скорость генерации (latency), и как модель ведёт себя на мультимодальных задачах — источник этого не касается.
Итог простой: Grok 4.7 — это не «самая способная модель xAI», которую стоит рассматривать как альтернативу GPT-6 или Claude Fable 5.1. Это бюджетная опция с понятными ограничениями. Если цена — ваш главный критерий, а задачи не требуют автономной агентной работы, модель заслуживает теста. Во всех остальных случаях разрыв в бенчмарках говорит сам за себя.



