11 сентября Cognition открыла доступ к Fusion в десктоп-приложении и CLI Devin — раньше эта схема работала только в облаке. Идея простая: одна модель думает, вторая пишет код, и обе делают это параллельно, а не по очереди. Если вы уже гоняете агентов на реальных задачах и считаете токены, эта статья — про то, как включить связку у себя и на что смотреть в бенчмарках, прежде чем доверять ей продакшн-код.

Зачем нужна вторая модель, если первая и так справляется

Обычный подход — маршрутизация: система смотрит на входящий запрос и решает, какую модель дать задаче целиком. Проблема в том, что сложность задачи часто выясняется не в момент постановки, а уже в процессе изучения репозитория. Простой на вид тикет может обернуться правкой в пяти файлах с легаси-зависимостями, а маршрутизатор об этом не узнает, пока не поздно.

Второй момент — цена переключения. Если на середине работы понадобилось сменить модель, весь контекст (история диалога, прочитанные файлы, план) приходится пересобирать заново. Это съедает и время, и деньги.

Fusion решает обе проблемы иначе: вместо выбора одной модели на старте запускаются сразу две, каждая со своим постоянным контекстом.

Кто есть кто: лидер и исполнитель

В архитектуре Fusion два агента с разными ролями.

Ведущий агент (лидер) общается с пользователем, разбирается с неоднозначными формулировками задачи и решает, что делать самому, а что отдать напарнику. Именно он несёт ответственность за итоговый результат.

Исполнитель изучает файлы проекта, пишет код и тесты, чинит ошибки и возвращает результат лидеру на проверку. У него свои инструменты и свой кэшируемый контекст — он не начинает с нуля при каждом обращении.

Cognition рекомендует пару Claude Fable 5.1 (лидер) и SWE-2 (исполнитель) как дефолтную конфигурацию для десктопа и CLI.

Логика делегирования на уровне конфигурации выглядит примерно так:

json
{
  "leader_model": "Fable 5.1",
  "executor_model": "SWE-2",
  "delegation": {
    "research_depth": "medium",
    "executor_can_push_back": true,
    "task_description_verbosity": "detailed"
  }
}

Это не точный формат API Cognition, а иллюстрация того, какие параметры реально влияют на поведение связки: насколько подробно лидер формулирует задачу, может ли исполнитель возражать и сколько самостоятельного исследования кода ему разрешено.

Что показывают цифры на Artificial Analysis Coding Agent Index

Cognition опубликовала сравнение Fusion с базовыми конфигурациями на индексе Artificial Analysis Coding Agent v1.5.

СвязкаБаллБалл базовой конфигурацииСнижение стоимости
Fable 5.1 + SWE-261,762,2 (Claude Code + Fable 5.1)36%
Astra + SWE-258,961,6 (Codex + Astra)39%

Разница в качестве минимальна, а экономия — существенная. Но на отдельных бенчмарках картина неоднородна.

БенчмаркFable 5.1Fusion (Fable 5.1 + SWE-2)Стоимость: было → сталоЭкономия
DeepSWE 1.164,363,1$14,63 → $7,8846%
Terminal-Bench 457,656,1$17,46 → $13,3723%
FrontierCode 1.1 Extended63,663,5$2,68 → $1,6738%

На Astra в Terminal-Bench 4 экономия доходит до 40%, но результат падает с 55,6 до 50,0 балла — это уже заметная просадка, а не погрешность. Cognition прямо предупреждает: цифры относятся к конкретным тестам и конкретным конфигурациям, переносить их на произвольный проект нельзя.

Почему дорогая модель иногда обходится дешевле

Отдельное наблюдение компании касается не связки, а поведения самого лидера. В июльском эксперименте Fable 5 стоила вдвое дороже Opus 4.8 за токен, но с одним и тем же исполнителем вышла дешевле по итогам всего запуска: $1,86 против $2,04 в среднем. При этом качество результата было выше — 60,7 против 54,6.

Разгадка в количестве шагов: Fable делегировала работу раньше и реже дублировала действия исполнителя — в среднем 11,5 шага против 26,5 у Opus. Более дорогая модель за счёт меньшего числа обращений и меньшего объёма обрабатываемого контекста в итоге оказалась экономичнее. Вывод практический: цена токена — не то же самое, что цена задачи. Считать нужно end-to-end.

Как включить Fusion и что настроить под себя

Fusion сейчас доступен в Devin Desktop и Devin CLI — раньше он работал только в облачной версии продукта. Дефолтная пара — Fable 5.1 в роли лидера и SWE-2 в роли исполнителя, но Cognition подчёркивает: харнес нужно донастраивать под конкретную пару моделей, а не полагаться на дефолт вслепую.

Три параметра, которые реально влияют на результат:

  • Подробность постановки задачи — насколько детально лидер формулирует ТЗ для исполнителя.
  • Допустимость возражений исполнителя — может ли он вернуть задачу с уточняющим вопросом вместо попытки угадать.
  • Объём делегируемого исследования кода — сколько файлов и зависимостей исполнитель имеет право изучать сам, без участия лидера.

Если вы работаете с собственным харнесом (например, ролями агентов и скиллами, как это устроено в KodaCode), эти же три рычага стоит проверить в первую очередь при смене модели-исполнителя — именно они чаще всего ломают экономику связки.

Где ломается такая архитектура

Двухагентная схема не бесплатный обед. Есть три места, где она регулярно даёт сбой.

Первое — несоответствие пары моделей задаче. Связка, показавшая хороший результат на FrontierCode, может проседать на Terminal-Bench — бенчмарки не взаимозаменяемы, и ваш проект скорее всего не похож ни на один из них целиком.

Второе — слепое доверие дефолтной конфигурации. Cognition прямо говорит, что харнес требует настройки под пару моделей; копипаста дефолта с сайта редко даёт заявленные цифры на реальном коде.

Третье — экономия ценой качества. Падение с 55,6 до 50,0 балла на Terminal-Bench 4 при 40% экономии — это тот случай, когда для критичного продакшн-кода дешевле не значит лучше.

Что попробовать дальше

Начните с дефолтной пары Fable 5.1 + SWE-2 на некритичной задаче — рефакторинге тестового модуля или добавлении простого эндпоинта. Сравните время, стоимость и число итераций с тем, как эту же задачу решает одна модель без Fusion. Дальше меняйте один параметр харнеса за раз — подробность задания или допустимость возражений исполнителя — и смотрите, что сильнее влияет на результат именно в вашем стеке.

FAQ

Fusion — это отдельный продукт или часть Devin?

Это функция внутри Devin: раньше работала только в облаке, с 11 сентября доступна также в Desktop-приложении и CLI.

Можно ли использовать любые модели в паре лидер-исполнитель?

Технически харнес допускает разные комбинации, но Cognition официально рекомендует и тестирует Fable 5.1 в роли лидера и SWE-2 в роли исполнителя как базовую конфигурацию.

Экономия в 30-40% гарантирована на любом проекте?

Нет. Цифры получены на конкретных бенчмарках (DeepSWE, Terminal-Bench, FrontierCode) с конкретными конфигурациями моделей и не переносятся автоматически на произвольную кодовую базу.

Что делать, если Fusion теряет в качестве по сравнению с одной моделью?

Начать с настройки трёх параметров харнеса: подробности постановки задачи, допустимости возражений исполнителя и объёма делегируемого исследования кода — именно они чаще всего определяют разницу в результате.

Чем харнес Fusion отличается от обычного роутинга моделей?

Обычный роутинг выбирает одну модель по стартовому запросу и работает с ней до конца задачи. Fusion держит две модели одновременно, каждую с отдельным сохраняемым контекстом, и перераспределяет работу по ходу выполнения, а не только на старте.

Источники