Автономные AI-агенты, которые сами дорабатывают свою рабочую среду, быстро скатываются в запоминание тестовых задач вместо реального улучшения. Google Cloud AI Research совместно с несколькими университетами представили метод RRSI, который останавливает переобучение, сокращает расходы на вычисления на 30% и поднимает точность на новых задачах до 4,7 процентных пункта.

Почему агенты перестают развиваться

Современные AI-агенты — это неизменная языковая модель плюс harness (упряжь) вокруг неё: набор промптов, логики, инструментов и памяти, который решает, какой файл прочитать перед правкой, как восстановиться после ошибки и как упаковать результат. По данным исследования, большая часть недавнего прогресса в агентах идёт именно от работы над этой упряжью, а не от новых моделей.

Раньше упряжь правили вручную: анализировали провалы и латали код. Новые методы автоматизируют цикл — языковая модель переписывает упряжь сама на основе обратной связи от тестовых задач. Исследователи называют это практической формой рекурсивного самоулучшения: система генерирует фидбек, который оптимизирует упряжь, которая контролирует поведение самой системы.

Проблема в том, что агент крутится на одном и том же ограниченном наборе тестов. В итоге он их заучивает: точность на обучающих задачах растёт, а на новых, невиданных — стоит или падает. Команда выделила три механизма: поиск запоминает паттерны, специфичные для одного бенчмарка, выбирает кандидатов, которые выиграли случайно, и наращивает сложность, которая поднимает балл, но не делает агента лучше.

Бюджет правок и жёсткий критик против запоминания

Метод RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) работает на двух концах петли оптимизации, оставляя упряжь полностью редактируемой.

На этапе генерации изменений бюджет ограничивает, сколько независимых правок можно упаковать в один кандидат. Бюджет сжимается со временем: ранние раунды разрешают крупные переписывания, поздние — только точечные изменения с чётко отслеживаемым эффектом. Система запоминает провалившиеся попытки, чтобы не гонять одни и те же идеи, и когда прогресс стопорится, нарочно трогает части упряжи, до которых ещё не дошли руки.

На этапе отбора критик проверяет каждое предложение и выбрасывает те, что захардкодили имена задач, готовые решения или другие хаки, специфичные для бенчмарка. Второе правило принимает рост затрат на вычисления только если вместе с ним измеримо выросла точность. Компоненты, которые перестали помогать, удаляются.

Как это работает на практике

Команда протестировала RRSI на восьми бенчмарках: программирование, офисная работа агентов, инженерное проектирование. Базовая модель — Claude Opus 4.8 — оставалась заморожена. Сравнивали с исходной упряжью и четырьмя свежими методами оптимизации.

По данным статьи, RRSI добавил до 14,1 процентного пункта на задачах, на которых обучался, и до 4,7 п.п. на пяти бенчмарках, которые система никогда не видела. Расход токенов на рантайм упал примерно на 30% по сравнению с версией без регуляризации. Общая точность ни разу не опустилась ниже базовой упряжи ни на одном из невиданных тестов — обычная проблема переобученных систем.

МетодПрирост на обучающих задачахПрирост на новых задачахРасход токенов
Базовая упряжь0 п.п.0 п.п.минимальный
Метод A+16 п.п.−2 п.п.высокий
Метод B+18 п.п.+0.5 п.п.высокий
RRSI+14.1 п.п.+4.7 п.п.−30% к неограниченной версии

RRSI показал самый скромный рост на обучающих задачах из всех оптимизированных вариантов и единственный уверенно превзошёл базовую упряжь на невиданных. Защитные ограничения созданы именно ради этого баланса.

Упряжь, оптимизированная на Gemini 3.5 Flash, подняла точность гораздо более слабой модели Gemini 3.1 Flash Lite с 11,2 до 14,6 п.п. без доработок. Найденные механизмы не зависят от возможностей модели, на которой их обнаружили.

Где это ломается

Авторы подчёркивают, что исследование охватывает только упряжи вокруг замороженных моделей и не касается случаев, когда меняются веса самой модели.

Вручную спроектированные упряжи часто не переносятся на новые задачи. В тестах на ARC-AGI-3 Opus 4.6 с целевой упряжью набрал 97,1% в привычной среде и 0% в незнакомой. Это показывает, насколько хрупкими могут быть решения, заточенные под конкретный тест.

Что попробовать в следующий раз

Nvidia недавно представила SoL-Pi — близкий метод, где исследовательский агент автоматически перестраивает упряжь кодирующих агентов. Расход токенов падает до 49% без заметной потери качества. Чуть раньше Google заставлял агентов «мечтать» о прошлых поисковых сессиях, чтобы улучшить стратегию поиска — модель тоже оставалась неизменной.

RRSI доступен на GitHub. Исследование подтверждает, что саморазвитие AI-агентов становится надёжным инструментом только когда повторяющаяся обратная связь закрепляется в постоянных изменениях — и только если есть механизмы, которые не дают системе заучивать тесты вместо настоящего обучения.

Источники