# Devin Fusion: связка двух ИИ-моделей и экономия до 39%
Каноническая страница: https://plainews.ru/posts/devin-fusion-dva-ii-agenta
Опубликовано: 2026-09-13T11:01:22.446Z

Как работает Devin Fusion от Cognition — лидер планирует, исполнитель кодит. Разбираем архитектуру, бенчмарки и что учитывать перед внедрением в свой проект.
11 сентября Cognition открыла доступ к Fusion в десктоп-приложении и CLI Devin — раньше эта схема работала только в облаке. Идея простая: одна модель думает, вторая пишет код, и обе делают это параллельно, а не по очереди. Если вы уже гоняете агентов на реальных задачах и считаете токены, эта статья — про то, как включить связку у себя и на что смотреть в бенчмарках, прежде чем доверять ей продакшн-код.

## Зачем нужна вторая модель, если первая и так справляется

Обычный подход — маршрутизация: система смотрит на входящий запрос и решает, какую модель дать задаче целиком. Проблема в том, что сложность задачи часто выясняется не в момент постановки, а уже в процессе изучения репозитория. Простой на вид тикет может обернуться правкой в пяти файлах с легаси-зависимостями, а маршрутизатор об этом не узнает, пока не поздно.

Второй момент — цена переключения. Если на середине работы понадобилось сменить модель, весь контекст (история диалога, прочитанные файлы, план) приходится пересобирать заново. Это съедает и время, и деньги.

Fusion решает обе проблемы иначе: вместо выбора одной модели на старте запускаются сразу две, каждая со своим постоянным контекстом.

## Кто есть кто: лидер и исполнитель

В архитектуре Fusion два агента с разными ролями.

**Ведущий агент (лидер)** общается с пользователем, разбирается с неоднозначными формулировками задачи и решает, что делать самому, а что отдать напарнику. Именно он несёт ответственность за итоговый результат.

**Исполнитель** изучает файлы проекта, пишет код и тесты, чинит ошибки и возвращает результат лидеру на проверку. У него свои инструменты и свой кэшируемый контекст — он не начинает с нуля при каждом обращении.

Cognition рекомендует пару Claude Fable 5.1 (лидер) и SWE-2 (исполнитель) как дефолтную конфигурацию для десктопа и CLI.

> **К сведению.** Разделение ролей не жёсткое: харнес можно настроить так, чтобы лидер брал на себя больше рутины сам, если помощник плохо справляется с конкретным типом задач.

Логика делегирования на уровне конфигурации выглядит примерно так:

```json
{
  "leader_model": "Fable 5.1",
  "executor_model": "SWE-2",
  "delegation": {
    "research_depth": "medium",
    "executor_can_push_back": true,
    "task_description_verbosity": "detailed"
  }
}
```

Это не точный формат API Cognition, а иллюстрация того, какие параметры реально влияют на поведение связки: насколько подробно лидер формулирует задачу, может ли исполнитель возражать и сколько самостоятельного исследования кода ему разрешено.

## Что показывают цифры на Artificial Analysis Coding Agent Index

Cognition опубликовала сравнение Fusion с базовыми конфигурациями на индексе Artificial Analysis Coding Agent v1.5.

| Связка | Балл | Балл базовой конфигурации | Снижение стоимости |
| --- | --- | --- | --- |
| Fable 5.1 + SWE-2 | 61,7 | 62,2 (Claude Code + Fable 5.1) | 36% |
| Astra + SWE-2 | 58,9 | 61,6 (Codex + Astra) | 39% |

Разница в качестве минимальна, а экономия — существенная. Но на отдельных бенчмарках картина неоднородна.

| Бенчмарк | Fable 5.1 | Fusion (Fable 5.1 + SWE-2) | Стоимость: было → стало | Экономия |
| --- | --- | --- | --- | --- |
| DeepSWE 1.1 | 64,3 | 63,1 | $14,63 → $7,88 | 46% |
| Terminal-Bench 4 | 57,6 | 56,1 | $17,46 → $13,37 | 23% |
| FrontierCode 1.1 Extended | 63,6 | 63,5 | $2,68 → $1,67 | 38% |

На Astra в Terminal-Bench 4 экономия доходит до 40%, но результат падает с 55,6 до 50,0 балла — это уже заметная просадка, а не погрешность. Cognition прямо предупреждает: цифры относятся к конкретным тестам и конкретным конфигурациям, переносить их на произвольный проект нельзя.

## Почему дорогая модель иногда обходится дешевле

Отдельное наблюдение компании касается не связки, а поведения самого лидера. В июльском эксперименте Fable 5 стоила вдвое дороже Opus 4.8 за токен, но с одним и тем же исполнителем вышла дешевле по итогам всего запуска: $1,86 против $2,04 в среднем. При этом качество результата было выше — 60,7 против 54,6.

Разгадка в количестве шагов: Fable делегировала работу раньше и реже дублировала действия исполнителя — в среднем 11,5 шага против 26,5 у Opus. Более дорогая модель за счёт меньшего числа обращений и меньшего объёма обрабатываемого контекста в итоге оказалась экономичнее. Вывод практический: цена токена — не то же самое, что цена задачи. Считать нужно end-to-end.

## Как включить Fusion и что настроить под себя

Fusion сейчас доступен в Devin Desktop и Devin CLI — раньше он работал только в облачной версии продукта. Дефолтная пара — Fable 5.1 в роли лидера и SWE-2 в роли исполнителя, но Cognition подчёркивает: харнес нужно донастраивать под конкретную пару моделей, а не полагаться на дефолт вслепую.

Три параметра, которые реально влияют на результат:

- **Подробность постановки задачи** — насколько детально лидер формулирует ТЗ для исполнителя.
- **Допустимость возражений исполнителя** — может ли он вернуть задачу с уточняющим вопросом вместо попытки угадать.
- **Объём делегируемого исследования кода** — сколько файлов и зависимостей исполнитель имеет право изучать сам, без участия лидера.

Если вы работаете с собственным харнесом (например, ролями агентов и скиллами, как это устроено в KodaCode), эти же три рычага стоит проверить в первую очередь при смене модели-исполнителя — именно они чаще всего ломают экономику связки.

## Где ломается такая архитектура

Двухагентная схема не бесплатный обед. Есть три места, где она регулярно даёт сбой.

Первое — несоответствие пары моделей задаче. Связка, показавшая хороший результат на FrontierCode, может проседать на Terminal-Bench — бенчмарки не взаимозаменяемы, и ваш проект скорее всего не похож ни на один из них целиком.

Второе — слепое доверие дефолтной конфигурации. Cognition прямо говорит, что харнес требует настройки под пару моделей; копипаста дефолта с сайта редко даёт заявленные цифры на реальном коде.

Третье — экономия ценой качества. Падение с 55,6 до 50,0 балла на Terminal-Bench 4 при 40% экономии — это тот случай, когда для критичного продакшн-кода дешевле не значит лучше.

## Что попробовать дальше

Начните с дефолтной пары Fable 5.1 + SWE-2 на некритичной задаче — рефакторинге тестового модуля или добавлении простого эндпоинта. Сравните время, стоимость и число итераций с тем, как эту же задачу решает одна модель без Fusion. Дальше меняйте один параметр харнеса за раз — подробность задания или допустимость возражений исполнителя — и смотрите, что сильнее влияет на результат именно в вашем стеке.

## FAQ

### Fusion — это отдельный продукт или часть Devin?

Это функция внутри Devin: раньше работала только в облаке, с 11 сентября доступна также в Desktop-приложении и CLI.

### Можно ли использовать любые модели в паре лидер-исполнитель?

Технически харнес допускает разные комбинации, но Cognition официально рекомендует и тестирует Fable 5.1 в роли лидера и SWE-2 в роли исполнителя как базовую конфигурацию.

### Экономия в 30-40% гарантирована на любом проекте?

Нет. Цифры получены на конкретных бенчмарках (DeepSWE, Terminal-Bench, FrontierCode) с конкретными конфигурациями моделей и не переносятся автоматически на произвольную кодовую базу.

### Что делать, если Fusion теряет в качестве по сравнению с одной моделью?

Начать с настройки трёх параметров харнеса: подробности постановки задачи, допустимости возражений исполнителя и объёма делегируемого исследования кода — именно они чаще всего определяют разницу в результате.

### Чем харнес Fusion отличается от обычного роутинга моделей?

Обычный роутинг выбирает одну модель по стартовому запросу и работает с ней до конца задачи. Fusion держит две модели одновременно, каждую с отдельным сохраняемым контекстом, и перераспределяет работу по ходу выполнения, а не только на старте.

## Источники

- Habr AI: Один ИИ кодит, второй командует: как устроен Devin Fusion
