Автономные AI-агенты, которые сами дорабатывают свою рабочую среду, быстро скатываются в запоминание тестовых задач вместо реального улучшения. Google Cloud AI Research совместно с несколькими университетами представили метод RRSI, который останавливает переобучение, сокращает расходы на вычисления на 30% и поднимает точность на новых задачах до 4,7 процентных пункта.
Почему агенты перестают развиваться
Современные AI-агенты — это неизменная языковая модель плюс harness (упряжь) вокруг неё: набор промптов, логики, инструментов и памяти, который решает, какой файл прочитать перед правкой, как восстановиться после ошибки и как упаковать результат. По данным исследования, большая часть недавнего прогресса в агентах идёт именно от работы над этой упряжью, а не от новых моделей.
Раньше упряжь правили вручную: анализировали провалы и латали код. Новые методы автоматизируют цикл — языковая модель переписывает упряжь сама на основе обратной связи от тестовых задач. Исследователи называют это практической формой рекурсивного самоулучшения: система генерирует фидбек, который оптимизирует упряжь, которая контролирует поведение самой системы.
Проблема в том, что агент крутится на одном и том же ограниченном наборе тестов. В итоге он их заучивает: точность на обучающих задачах растёт, а на новых, невиданных — стоит или падает. Команда выделила три механизма: поиск запоминает паттерны, специфичные для одного бенчмарка, выбирает кандидатов, которые выиграли случайно, и наращивает сложность, которая поднимает балл, но не делает агента лучше.
Бюджет правок и жёсткий критик против запоминания
Метод RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) работает на двух концах петли оптимизации, оставляя упряжь полностью редактируемой.
На этапе генерации изменений бюджет ограничивает, сколько независимых правок можно упаковать в один кандидат. Бюджет сжимается со временем: ранние раунды разрешают крупные переписывания, поздние — только точечные изменения с чётко отслеживаемым эффектом. Система запоминает провалившиеся попытки, чтобы не гонять одни и те же идеи, и когда прогресс стопорится, нарочно трогает части упряжи, до которых ещё не дошли руки.
На этапе отбора критик проверяет каждое предложение и выбрасывает те, что захардкодили имена задач, готовые решения или другие хаки, специфичные для бенчмарка. Второе правило принимает рост затрат на вычисления только если вместе с ним измеримо выросла точность. Компоненты, которые перестали помогать, удаляются.
Как это работает на практике
Команда протестировала RRSI на восьми бенчмарках: программирование, офисная работа агентов, инженерное проектирование. Базовая модель — Claude Opus 4.8 — оставалась заморожена. Сравнивали с исходной упряжью и четырьмя свежими методами оптимизации.
По данным статьи, RRSI добавил до 14,1 процентного пункта на задачах, на которых обучался, и до 4,7 п.п. на пяти бенчмарках, которые система никогда не видела. Расход токенов на рантайм упал примерно на 30% по сравнению с версией без регуляризации. Общая точность ни разу не опустилась ниже базовой упряжи ни на одном из невиданных тестов — обычная проблема переобученных систем.
| Метод | Прирост на обучающих задачах | Прирост на новых задачах | Расход токенов |
|---|---|---|---|
| Базовая упряжь | 0 п.п. | 0 п.п. | минимальный |
| Метод A | +16 п.п. | −2 п.п. | высокий |
| Метод B | +18 п.п. | +0.5 п.п. | высокий |
| RRSI | +14.1 п.п. | +4.7 п.п. | −30% к неограниченной версии |
RRSI показал самый скромный рост на обучающих задачах из всех оптимизированных вариантов и единственный уверенно превзошёл базовую упряжь на невиданных. Защитные ограничения созданы именно ради этого баланса.
Упряжь, оптимизированная на Gemini 3.5 Flash, подняла точность гораздо более слабой модели Gemini 3.1 Flash Lite с 11,2 до 14,6 п.п. без доработок. Найденные механизмы не зависят от возможностей модели, на которой их обнаружили.
Где это ломается
Авторы подчёркивают, что исследование охватывает только упряжи вокруг замороженных моделей и не касается случаев, когда меняются веса самой модели.
Вручную спроектированные упряжи часто не переносятся на новые задачи. В тестах на ARC-AGI-3 Opus 4.6 с целевой упряжью набрал 97,1% в привычной среде и 0% в незнакомой. Это показывает, насколько хрупкими могут быть решения, заточенные под конкретный тест.
Что попробовать в следующий раз
Nvidia недавно представила SoL-Pi — близкий метод, где исследовательский агент автоматически перестраивает упряжь кодирующих агентов. Расход токенов падает до 49% без заметной потери качества. Чуть раньше Google заставлял агентов «мечтать» о прошлых поисковых сессиях, чтобы улучшить стратегию поиска — модель тоже оставалась неизменной.
RRSI доступен на GitHub. Исследование подтверждает, что саморазвитие AI-агентов становится надёжным инструментом только когда повторяющаяся обратная связь закрепляется в постоянных изменениях — и только если есть механизмы, которые не дают системе заучивать тесты вместо настоящего обучения.



