Один и тот же промпт скормили двум ИИ-агентам — вот что получилось у GPT-5.6 Sol Ultra
Разработчик прогнал один и тот же промпт через Claude Code и Codex с GPT-5.6 Sol Ultra — и получил принципиально разные игры с одинаковым багом.

Разработчик Саймон Уиллисон взял старую идею игры про воровство енотов, сгенерированную GPT-3 и DALL-E четыре года назад, и одним и тем же промптом попросил два разных агента собрать из неё рабочую игру. Claude Code (версия, которую он называет Fable 5) сделал скромный прототип с одним енотом на заднем дворе. Codex Desktop с GPT-5.6 Sol Ultra выдал полноценный музейный хейст с тремя персонажами — и заодно баг, который сам не заметил. История интересна не столько игрой, сколько тем, что она показывает о текущем состоянии агентских инструментов для кодинга.
От заднего двора до музея: почему результат так отличается
Исходное описание игры, сгенерированное GPT-3, звучало примерно так: команда воришек-енотов проворачивает серию дерзких ограблений — от банков до музеев с произведениями искусства. Ни одна работа не слишком крупная и не слишком мелкая для пушистой команды.
Claude Code интерпретировал это буквально и минималистично: один енот бегает по двору, собирает монеты и рыбу. Рабочая игра, но далёкая от премисы про команду грабителей.
GPT-5.6 Sol Ultra в Codex Desktop пошёл дальше по сюжету. В его версии игрок управляет одним енотом, но должен сначала освободить двух других членов банды, а затем построить из них пирамиду, чтобы дотянуться до золотой сардины в музейной витрине. Это ближе к духу оригинальной идеи про командный хейст, а не про одиночный забег за монетками.
Разница показательна: один и тот же промпт при одинаковом уровне детализации может дать совершенно разную глубину проработки сюжета в зависимости от того, какая модель и какой агентский режим стоят за генерацией.
Что такое режим Sol Ultra и при чём тут суб-агенты
Ключевая деталь эксперимента — GPT-5.6 Sol Ultra запускался в режиме, где модель агрессивно использует суб-агентов (sub-agents). Это значит, что вместо одного потока рассуждений и генерации кода задача разбивается на параллельные подзадачи, которые выполняют отдельные вспомогательные агенты — например, один пишет игровую логику, другой генерирует текстуры, третий собирает сцену.
Такой подход объясняет, почему в проекте оказались собственные текстуры и промпты для генерации изображений через gpt-image-2 — модель не просто написала код, а организовала полноценный пайплайн подготовки арта для игры. Библиотека Three.js (для рендеринга 3D-графики в браузере) была подключена локально, вместе с закоммиченными в репозиторий материалами.
Если вы хотите повторить подобный эксперимент, вот из чего он состоит:
```text
код игры, генерация текстур, сборка сцены, тестирование ```
- Открываете Codex Desktop
- Выбираете модель GPT-5.6 Sol Ultra в режиме с суб-агентами
- Даёте один развёрнутый промпт с описанием игры (жанр, сюжет, механику)
- Ждёте, пока агент сам решит, как декомпозировать задачу:
Весь процесс занял 52 минуты — от одного промпта до играбельного прототипа с сгенерированными текстурами.
Баг, который агент не заметил сам
Несмотря на то, что Codex во время разработки просматривал скриншоты результата, он пропустил заметный визуальный баг: у каждого енота над головой висел огромный чёрный шар — это был непропорционально увеличенный глаз персонажа. То есть модель самостоятельно проверяла промежуточные результаты, но не смогла интерпретировать явную визуальную аномалию как ошибку.
Исправление заняло два коротких промпта подряд:
``text Промпт 1: Why do the raccoons have huge black spheres on them? Промпт 2: Fix it ``
Этого оказалось достаточно — агент сам нашёл причину (некорректный масштаб меша глаза) и поправил модель. Никакого детального технического объяснения бага от пользователя не потребовалось.
Вывод простой и практичный: даже когда агент утверждает, что проверил результат по скриншотам, стоит запускать игру вручную и смотреть глазами. LLM пока плохо распознают "очевидные для человека" визуальные ошибки на автопилоте, зато отлично чинят их, если на баг прямо указать.
Сколько стоит такой эксперимент в деньгах
Уиллисон использовал месячную подписку на Codex, а не оплату по токенам напрямую, поэтому реальный счёт за сессию он не увидел. Но в отчёте AgentsView — инструменте, который оценивает, во сколько обошлась бы сессия по полным ценам API, — есть примерная стоимость этих 52 минут работы с суб-агентами.
Смысл в том, что при активном использовании суб-агентов (а не одной модели последовательно) стоимость по API может быть заметно выше, чем кажется по времени работы — параллельные вызовы моделей суммируются. Если вы планируете переносить такие эксперименты с подписки на pay-as-you-go API, стоит заранее прогнать оценку через подобный инструмент, чтобы не удивляться счёту.
Подводные камни
Первое: агентский режим с суб-агентами даёт более богатый результат, но не гарантирует отсутствие ошибок — саморефлексия по скриншотам не заменяет ручного тестирования.
Второе: у Codex есть удобная функция "скопировать как Markdown" для транскрипта всей сессии — это упрощает документирование и публикацию процесса в репозитории. У Claude Code такой функции пока нет, и это заметно усложняет шаринг логов работы агента.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

