Сотрудник OpenAI, отвечающий за безопасность агентов, публично описал ситуацию, с которой столкнулась компания: модели внезапно демонстрировали новые опасные возможности — и организация каждый раз оказывалась не готова. Это не теоретическое предупреждение, а ретроспектива реальных инцидентов.

Что именно произошло внутри OpenAI

Сотрудник OpenAI с ником @joedaroo, занимающий позицию в направлении Agent Security и верифицированный изданием The Information, описал паттерн, который повторялся внутри компании. Модели неожиданно приобретали новые возможности в областях, связанных с кибератаками, координацией («swarming») и активностью на форумах и досках объявлений. Каждый такой скачок происходил быстро и без предупреждения.

По его словам, называть это «сюрпризом» — значит преуменьшать масштаб проблемы. Компания не просто не успевала обновить технические защиты — она не успевала перестроить культуру и процессы внутри команд.

Почему технических мер недостаточно

Ключевой тезис из его высказывания: безопасность — это не только про системы, это про людей. Выстроить защитную культуру в организации занимает время. Сотрудники должны сами меняться вместе с угрозами, понимать, что делать в нештатной ситуации, знать, как реагировать и к кому обращаться.

Когда возможности модели вырастают за недели, а не за месяцы, этот процесс просто не успевает завершиться. Получается разрыв: модель уже умеет больше, а команда ещё живёт в старой картине мира.

Это системная проблема, а не единичный провал. Именно поэтому @joedaroo говорит о ней публично — чтобы другие организации не повторяли тот же путь.

Что это значит для всех, кто работает с ИИ

Его обращение адресовано не только коллегам по индустрии, но и любой организации, которая внедряет или планирует внедрять ИИ-системы. Он формулирует конкретные вопросы, которые стоит задать себе прямо сейчас:

ВопросЧто проверяем
Устойчивы ли люди, системы и процессы к сюрпризам?Готовность к неожиданному скачку возможностей
Знают ли команды, что делать при инциденте?Наличие и отработанность incident response
Готовы ли коммуникации и месседжинг?Внутренние и внешние каналы реагирования
Есть ли нужные люди на готовности?Кадровый резерв под кризисные сценарии

Это не абстрактный чеклист. Судя по описанию, именно отсутствие ответов на эти вопросы создавало «крайне сложные проблемы» внутри самой OpenAI.

Чего мы не знаем

Высказывание @joedaroo не раскрывает конкретных инцидентов: какие именно модели, когда, с какими последствиями. Неизвестно, были ли эти скачки связаны с реальным внешним вредом или остались внутри тестовых сред. Также непонятно, как именно OpenAI изменила свои процессы после этих эпизодов и изменила ли вообще.

Скачки возможностей — новая норма, к которой никто не готов

Похоже, что описанная ситуация — не исключение для OpenAI, а структурная особенность нынешнего этапа развития больших языковых моделей. Возможности растут нелинейно, и даже команда, создающая модели, не всегда может предсказать, что именно и когда появится.

Для разработчиков и продуктологов, которые строят продукты поверх таких моделей, это означает одно: планировать безопасность «на потом» — значит гарантированно опаздывать. Если даже OpenAI признаёт, что не успевала, то организации с меньшими ресурсами окажутся в ещё более уязвимой позиции.

Источники