xAI Илона Маска выпустила Grok 4.7 — по заявлению компании, самую способную модель в линейке для кода и работы со знаниями. Цена выглядит агрессивно: $2 за миллион входящих токенов и $6 за исходящие. Но независимые бенчмарки сразу расставили всё по местам.

Что внутри новой модели

xAI описывает Grok 4.7 тремя тезисами: более крупная базовая модель, более длинное обучение с подкреплением (reinforcement learning — метод, при котором модель учится на собственных ошибках через систему наград) и улучшенная верификация собственных ответов. Конкретных архитектурных деталей — размера модели, количества параметров, данных для обучения — компания не раскрыла.

Доступна модель через три канала: Grok API, редактор кода Cursor и платформу Grok Build.

Цифры, которые объясняют цену

На независимом Artificial Analysis Intelligence Index версии 4.3.2, агрегирующем десять разных бенчмарков, Grok 4.7 набирает 46 баллов. Claude Fable 5.1 и GPT-6 — по 53 каждый. Разрыв в 7 баллов на интегральном индексе — это уже не погрешность.

В агентном кодировании (задачи, где модель самостоятельно пишет, запускает и правит код в терминале) картина хуже. На Terminal-Bench 4.0:

МодельTerminal-Bench 4.0
GPT-6 Astra60%
Claude Fable 5.155%
DeepSeek V4.1 Flash27%
Grok 4.726%

Grok 4.7 не просто отстаёт от лидеров вдвое — его обходит даже более дешёвый DeepSeek V4.1 Flash с результатом 27%. Один процентный пункт разницы при таком отставании от топа — это статистический шум, а не конкурентное преимущество.

Отдельно в источнике отмечается: два высших уровня рассуждения у Grok 4.7 показывают примерно одинаковые результаты. Это косвенно говорит о том, что модель не масштабируется на самых сложных задачах так, как ожидалось от более крупной базы.

Кому это реально нужно

Ценовое позиционирование — $2/$6 за миллион токенов — действительно ближе к китайским моделям, чем к западным фронтирным. Для сравнения: GPT-6 и Claude Fable 5.1 стоят существенно дороже (конкретные цифры в источнике не приводятся, но разрыв xAI называет принципиальным).

Это делает Grok 4.7 потенциально интересным в нескольких сценариях:

Высокий объём, низкая сложность. Если задача — классификация, суммаризация или генерация шаблонного текста в масштабе миллиардов токенов в месяц, разрыв в качестве может не иметь значения, а экономия — иметь.

Эксперименты и прототипирование. Cursor уже интегрирован — разработчик может попробовать модель без дополнительной настройки. Для быстрой проверки гипотезы цена входа низкая.

Не агентные задачи. Результат 26% на Terminal-Bench 4.0 означает, что доверять Grok 4.7 автономную работу в терминале — плохая идея. Для разовых запросов и помощи с кодом внутри чата ситуация может быть лучше, но бенчмарк это не измеряет.

Где это ломается и чего в релизе нет

Главная проблема — агентное кодирование сейчас является одним из ключевых сценариев для моделей такого класса. Именно туда идут деньги корпоративных покупателей: автономные агенты, CI/CD-интеграции, рефакторинг больших кодовых баз. Результат 26% на Terminal-Bench 4.0 закрывает этот рынок для Grok 4.7 на текущем этапе.

xAI не опубликовала собственные бенчмарки, методологию обучения или сравнительные таблицы — только словесные тезисы про «более крупную базу» и «более длинное RL». Это стандартная практика для релизов, где цифры не работают в пользу компании.

Также неизвестно: есть ли у Grok 4.7 контекстное окно большего размера по сравнению с предыдущими версиями, какова скорость генерации (latency), и как модель ведёт себя на мультимодальных задачах — источник этого не касается.

Итог простой: Grok 4.7 — это не «самая способная модель xAI», которую стоит рассматривать как альтернативу GPT-6 или Claude Fable 5.1. Это бюджетная опция с понятными ограничениями. Если цена — ваш главный критерий, а задачи не требуют автономной агентной работы, модель заслуживает теста. Во всех остальных случаях разрыв в бенчмарках говорит сам за себя.

Источники