11 сентября Cognition открыла доступ к Fusion в десктоп-приложении и CLI Devin — раньше эта схема работала только в облаке. Идея простая: одна модель думает, вторая пишет код, и обе делают это параллельно, а не по очереди. Если вы уже гоняете агентов на реальных задачах и считаете токены, эта статья — про то, как включить связку у себя и на что смотреть в бенчмарках, прежде чем доверять ей продакшн-код.
Зачем нужна вторая модель, если первая и так справляется
Обычный подход — маршрутизация: система смотрит на входящий запрос и решает, какую модель дать задаче целиком. Проблема в том, что сложность задачи часто выясняется не в момент постановки, а уже в процессе изучения репозитория. Простой на вид тикет может обернуться правкой в пяти файлах с легаси-зависимостями, а маршрутизатор об этом не узнает, пока не поздно.
Второй момент — цена переключения. Если на середине работы понадобилось сменить модель, весь контекст (история диалога, прочитанные файлы, план) приходится пересобирать заново. Это съедает и время, и деньги.
Fusion решает обе проблемы иначе: вместо выбора одной модели на старте запускаются сразу две, каждая со своим постоянным контекстом.
Кто есть кто: лидер и исполнитель
В архитектуре Fusion два агента с разными ролями.
Ведущий агент (лидер) общается с пользователем, разбирается с неоднозначными формулировками задачи и решает, что делать самому, а что отдать напарнику. Именно он несёт ответственность за итоговый результат.
Исполнитель изучает файлы проекта, пишет код и тесты, чинит ошибки и возвращает результат лидеру на проверку. У него свои инструменты и свой кэшируемый контекст — он не начинает с нуля при каждом обращении.
Cognition рекомендует пару Claude Fable 5.1 (лидер) и SWE-2 (исполнитель) как дефолтную конфигурацию для десктопа и CLI.
Логика делегирования на уровне конфигурации выглядит примерно так:
{
"leader_model": "Fable 5.1",
"executor_model": "SWE-2",
"delegation": {
"research_depth": "medium",
"executor_can_push_back": true,
"task_description_verbosity": "detailed"
}
}Это не точный формат API Cognition, а иллюстрация того, какие параметры реально влияют на поведение связки: насколько подробно лидер формулирует задачу, может ли исполнитель возражать и сколько самостоятельного исследования кода ему разрешено.
Что показывают цифры на Artificial Analysis Coding Agent Index
Cognition опубликовала сравнение Fusion с базовыми конфигурациями на индексе Artificial Analysis Coding Agent v1.5.
| Связка | Балл | Балл базовой конфигурации | Снижение стоимости |
|---|---|---|---|
| Fable 5.1 + SWE-2 | 61,7 | 62,2 (Claude Code + Fable 5.1) | 36% |
| Astra + SWE-2 | 58,9 | 61,6 (Codex + Astra) | 39% |
Разница в качестве минимальна, а экономия — существенная. Но на отдельных бенчмарках картина неоднородна.
| Бенчмарк | Fable 5.1 | Fusion (Fable 5.1 + SWE-2) | Стоимость: было → стало | Экономия |
|---|---|---|---|---|
| DeepSWE 1.1 | 64,3 | 63,1 | $14,63 → $7,88 | 46% |
| Terminal-Bench 4 | 57,6 | 56,1 | $17,46 → $13,37 | 23% |
| FrontierCode 1.1 Extended | 63,6 | 63,5 | $2,68 → $1,67 | 38% |
На Astra в Terminal-Bench 4 экономия доходит до 40%, но результат падает с 55,6 до 50,0 балла — это уже заметная просадка, а не погрешность. Cognition прямо предупреждает: цифры относятся к конкретным тестам и конкретным конфигурациям, переносить их на произвольный проект нельзя.
Почему дорогая модель иногда обходится дешевле
Отдельное наблюдение компании касается не связки, а поведения самого лидера. В июльском эксперименте Fable 5 стоила вдвое дороже Opus 4.8 за токен, но с одним и тем же исполнителем вышла дешевле по итогам всего запуска: $1,86 против $2,04 в среднем. При этом качество результата было выше — 60,7 против 54,6.
Разгадка в количестве шагов: Fable делегировала работу раньше и реже дублировала действия исполнителя — в среднем 11,5 шага против 26,5 у Opus. Более дорогая модель за счёт меньшего числа обращений и меньшего объёма обрабатываемого контекста в итоге оказалась экономичнее. Вывод практический: цена токена — не то же самое, что цена задачи. Считать нужно end-to-end.
Как включить Fusion и что настроить под себя
Fusion сейчас доступен в Devin Desktop и Devin CLI — раньше он работал только в облачной версии продукта. Дефолтная пара — Fable 5.1 в роли лидера и SWE-2 в роли исполнителя, но Cognition подчёркивает: харнес нужно донастраивать под конкретную пару моделей, а не полагаться на дефолт вслепую.
Три параметра, которые реально влияют на результат:
- Подробность постановки задачи — насколько детально лидер формулирует ТЗ для исполнителя.
- Допустимость возражений исполнителя — может ли он вернуть задачу с уточняющим вопросом вместо попытки угадать.
- Объём делегируемого исследования кода — сколько файлов и зависимостей исполнитель имеет право изучать сам, без участия лидера.
Если вы работаете с собственным харнесом (например, ролями агентов и скиллами, как это устроено в KodaCode), эти же три рычага стоит проверить в первую очередь при смене модели-исполнителя — именно они чаще всего ломают экономику связки.
Где ломается такая архитектура
Двухагентная схема не бесплатный обед. Есть три места, где она регулярно даёт сбой.
Первое — несоответствие пары моделей задаче. Связка, показавшая хороший результат на FrontierCode, может проседать на Terminal-Bench — бенчмарки не взаимозаменяемы, и ваш проект скорее всего не похож ни на один из них целиком.
Второе — слепое доверие дефолтной конфигурации. Cognition прямо говорит, что харнес требует настройки под пару моделей; копипаста дефолта с сайта редко даёт заявленные цифры на реальном коде.
Третье — экономия ценой качества. Падение с 55,6 до 50,0 балла на Terminal-Bench 4 при 40% экономии — это тот случай, когда для критичного продакшн-кода дешевле не значит лучше.
Что попробовать дальше
Начните с дефолтной пары Fable 5.1 + SWE-2 на некритичной задаче — рефакторинге тестового модуля или добавлении простого эндпоинта. Сравните время, стоимость и число итераций с тем, как эту же задачу решает одна модель без Fusion. Дальше меняйте один параметр харнеса за раз — подробность задания или допустимость возражений исполнителя — и смотрите, что сильнее влияет на результат именно в вашем стеке.
FAQ
Fusion — это отдельный продукт или часть Devin?
Это функция внутри Devin: раньше работала только в облаке, с 11 сентября доступна также в Desktop-приложении и CLI.
Можно ли использовать любые модели в паре лидер-исполнитель?
Технически харнес допускает разные комбинации, но Cognition официально рекомендует и тестирует Fable 5.1 в роли лидера и SWE-2 в роли исполнителя как базовую конфигурацию.
Экономия в 30-40% гарантирована на любом проекте?
Нет. Цифры получены на конкретных бенчмарках (DeepSWE, Terminal-Bench, FrontierCode) с конкретными конфигурациями моделей и не переносятся автоматически на произвольную кодовую базу.
Что делать, если Fusion теряет в качестве по сравнению с одной моделью?
Начать с настройки трёх параметров харнеса: подробности постановки задачи, допустимости возражений исполнителя и объёма делегируемого исследования кода — именно они чаще всего определяют разницу в результате.
Чем харнес Fusion отличается от обычного роутинга моделей?
Обычный роутинг выбирает одну модель по стартовому запросу и работает с ней до конца задачи. Fusion держит две модели одновременно, каждую с отдельным сохраняемым контекстом, и перераспределяет работу по ходу выполнения, а не только на старте.
