OpenAI опубликовала внутренние данные о том, как их команда использует coding agents в повседневной работе. К середине августа 2026 года медианный исследователь тратит больше $600 в сутки на AI-инференс, а вся организация генерирует 3,1 агент-рабочих дня на каждый человеческий. Это не маркетинг — это операционная статистика, и она меняет то, как стоит думать о собственном инструментальном стеке.

Что происходит внутри OpenAI

Компания официально ввела аббревиатуру RSI — Recursive Self-Improvement (рекурсивное самоулучшение). Судя по всему, это их новое определение AGI: система, которая способна улучшать собственные исследовательские процессы. Об этом одновременно вышло два материала — внутренний отчёт об ускорении исследований и эссе главного учёного Якуба Пахоцкого «Alien Mind».

Ключевой сигнал — резкий скачок затрат на AI-инференс в конце июля 2026 года. Саймон Уиллисон (Simon Willison), который разобрал публикацию, предполагает: именно тогда сотрудники получили доступ к модели, позже вышедшей как GPT-6 Astra. До этого момента рост был постепенным; после — почти вертикальным.

Промежуточная цель уже достигнута: OpenAI получила «автоматизированного исследовательского стажёра». Следующий рубеж — полноценный «автоматизированный AI-исследователь» — запланирован на март 2028 года.

Как выглядит агентный стек на практике

Соотношение 3,1 агент-рабочих дня к 1 человеческому означает, что на каждый час живой работы приходится больше трёх часов автономной агентной активности. Это не «подсказки в чате» — это параллельные процессы, которые пишут код, запускают эксперименты и возвращают результаты.

Типичная схема, которую можно восстановить из описания:

  1. Исследователь формулирует задачу и передаёт её агенту.
  2. Агент разбивает задачу на подзадачи, запускает несколько параллельных веток.
  3. Каждая ветка — отдельный coding agent с доступом к инструментам: bash, Python REPL, файловая система, внешние API.
  4. Результаты агрегируются, исследователь проверяет и итерирует.

Затраты $600/день при текущих ценах API — это примерно 6–10 миллионов токенов в сутки на человека, в зависимости от модели. Большая часть уходит на длинные контекстные окна и многошаговые цепочки рассуждений.

Как настроить похожий процесс у себя

Вы не OpenAI, но архитектуру можно воспроизвести в меньшем масштабе. Вот минимальный рабочий стек.

Шаг 1. Выберите оркестратор агентов.

Для старта подойдут три варианта:

ИнструментЯзыкКогда брать
LangGraphPythonНужен контроль над графом состояний
CrewAIPythonБыстрый старт, мультиагентность из коробки
OpenAI Assistants APIREST/любойУже используете экосистему OpenAI

Шаг 2. Настройте изолированное окружение для агента.

Агент должен иметь доступ к инструментам, но не ломать продакшн. Минимальный контейнер:

plain
FROM python:3.12-slim
RUN pip install openai langgraph httpx
WORKDIR /workspace
# Агент работает только внутри /workspace

Шаг 3. Определите инструменты явно.

Не давайте агенту «всё подряд». Начните с трёх:

python
tools = [
    {"type": "code_interpreter"},          # выполнение Python
    {"type": "file_search"},               # поиск по документации
    {"type": "function", "function": run_tests},  # запуск тестов
]

Шаг 4. Запустите параллельные ветки.

Главный выигрыш в скорости — не один агент, а несколько одновременных:

python
import asyncio
from openai import AsyncOpenAI

client = AsyncOpenAI()

async def run_agent(task: str) -> str:
    response = await client.responses.create(
        model="gpt-4o",
        input=task,
        tools=tools,
    )
    return response.output_text

async def run_parallel(tasks: list[str]) -> list[str]:
    return await asyncio.gather(*[run_agent(t) for t in tasks])

Шаг 5. Добавьте мониторинг токенов.

Без учёта расходов вы не поймёте, где агент тратит время впустую:

python
# После каждого вызова логируйте usage
usage = response.usage
print(f"input: {usage.input_tokens}, output: {usage.output_tokens}")

Где это ломается

Контекстное окно переполняется. Длинные агентные цепочки быстро упираются в лимит. Решение — явное сжатие истории (summarization) каждые N шагов, а не передача полного лога.

Агент зацикливается. Без жёсткого ограничения на количество итераций агент может бесконечно «думать». Всегда задавайте max_turns или аналог.

Стоимость растёт нелинейно. Параллельные ветки умножают расходы. Начните с двух-трёх параллельных агентов, а не десяти.

Недетерминированность мешает отладке. Агент делает разные вещи при одном и том же промпте. Фиксируйте seed там, где API это поддерживает, и логируйте все вызовы инструментов.

Что попробовать дальше

Если базовый стек заработал — следующий шаг это специализированные агенты для конкретных задач: code review, генерация тестов, анализ логов. Посмотрите на SWE-agent и Aider как на готовые примеры узкоспециализированных coding agents с открытым кодом. Для мониторинга стоимости и качества ответов — LangSmith или Langfuse дают трейсинг на уровне каждого вызова инструмента.


FAQ

Что такое RSI в контексте OpenAI?

RSI — Recursive Self-Improvement, рекурсивное самоулучшение. OpenAI использует этот термин для описания систем, которые способны автоматически улучшать собственные исследовательские процессы. Фактически это их рабочее определение AGI на 2026 год.

Почему $600 в день — это важный ориентир?

Это медианная цифра по всей исследовательской организации, не топ-пользователи. Она показывает, что агентная работа стала нормой, а не экспериментом. Для команды из 10 человек это $6 000 в сутки только на инференс.

Можно ли воспроизвести такой стек без бюджета OpenAI?

Да, в меньшем масштабе. Начните с одного-двух параллельных агентов на задачу, используйте gpt-4o-mini для черновых шагов и gpt-4o только для финальной верификации. Это снижает стоимость в 5–10 раз при сохранении большей части качества.

Что такое GPT-6 Astra и когда он вышел?

По данным Саймона Уиллисона, GPT-6 Astra — модель, к которой сотрудники OpenAI получили внутренний доступ в конце июля 2026 года. Именно с этим моментом совпадает резкий рост затрат на инференс на графике OpenAI.

Что значит «3,1 агент-рабочих дня на 1 человеческий»?

На каждый час работы живого исследователя приходится 3,1 часа автономной агентной активности. Агенты работают параллельно и асинхронно — пока человек спит или занимается другой задачей.

Источники