Китайская лаборатория AllSpark выпустила два открытых поисковых агента: Iris-mini на 35 миллиардов параметров и Iris-pro на 397 миллиардов. Оба доступны на Hugging Face вместе с полным описанием процесса обучения. По четырём стандартным бенчмаркам — лучшие результаты среди open-weight систем в своих весовых категориях.
Что за модели и откуда взялись
Оба агента построены поверх серии Qwen: Iris-mini — на базе Qwen3.6-35B-A3B (35B параметров всего, 3B активных), Iris-pro — на базе Qwen3.5-397B-A17B (397B всего, 17B активных). Контекстное окно у обоих — 256 000 токенов.
Поисковый агент на языковой модели — это не просто «поиск с GPT». Система должна сама понять вопрос, решить что искать, разобрать результаты и определить, когда собрано достаточно данных для ответа. На практике многие такие системы используют веб в основном для подтверждения того, что модель и так знает из обучающих данных. AllSpark попыталась это исправить на уровне самого процесса обучения.
Как устроен пайплайн обучения
Обучающие задачи строятся в обратном направлении — от структуры ссылок реальных веб-страниц. Берётся стартовая страница с исходящими ссылками, из них составляется граф понятий и связей, из графа генерируется многошаговый вопрос. Все промежуточные термины заменяются перефразировками — чтобы нельзя было решить задачу простым текстовым поиском. Агент должен рассуждать, а не просто искать совпадения.
В датасет попадают только те вопросы, которые референсная модель не может решить без инструментов, но решает с нужными источниками. Это одновременно гарантирует сложность задач и их проверяемость.
Решения генерирует более сильная модель-учитель: она строит цепочки из рассуждений, поисковых запросов и результатов. Эти цепочки проходят двухэтапную фильтрацию. Первый этап проверяет корректность, наличие петель повторений и глубину поиска. Второй — пошаговая проверка моделью-судьёй, чьи критерии выведены из самих данных, а не заданы вручную.
После фильтрации модель дообучается через reinforcement learning с живым веб-поиском. Авторы называют итоговый процесс «SFT-RL climbing»: supervised fine-tuning и RL чередуются, а самые сложные решённые задачи и самые эффективные пути из каждого раунда уходят в следующий цикл.
Цифры по бенчмаркам
Тестирование проводилось на четырёх задачах: BrowseComp (поиск редких фактов по косвенным подсказкам), BrowseComp-ZH (китайский аналог), DeepSearchQA (полнота найденных доказательств) и Humanity's Last Exam — академические вопросы экспертного уровня.
| Модель | BrowseComp | BrowseComp-ZH | DeepSearchQA | HLE |
|---|---|---|---|---|
| Iris-mini (35B) | 82.2 | 84.8 | 86.9 | 52.3 |
| Iris-pro (397B) | 88.6 | 85.1 | 92.9 | 56.4 |
Iris-mini лидирует в своём классе на трёх из четырёх бенчмарков. На BrowseComp он обходит ближайшего конкурента, XYZ-Aquila-mini, на 3.4 пункта, но уступает ему на DeepSearchQA. Iris-pro лидирует или делит первое место в своём классе и местами приближается к системам, которые требуют значительно больше вычислительных ресурсов.
Почему управление контекстом важнее, чем кажется
Авторы отдельно поднимают тему, которую в сравнительных обзорах обычно замалчивают: управление контекстом на популярных бенчмарках часто даёт больший прирост, чем реальные различия между моделями.
Во время длинных исследовательских сессий контекст заполняется раньше, чем агент успевает закрыть все подвопросы. Трюки вроде сброса истории диалога формально продлевают исследование, но ничего не говорят о качестве самой модели.
Команда AllSpark тестировала каждый бенчмарк с управлением контекстом и без него, при одинаковых инструментах, лимитах и модели-судье. На Iris-mini эффект особенно заметен: на BrowseComp прирост от управления контекстом достигает 21.2 пункта. Причина не в меньшем бюджете токенов, а в том, что меньшая модель тратит больше шагов на те же задачи и чаще упирается в лимит.
Лучший результат достигается комбинацией сброса истории и второй попытки: если первый прогон не дал ответа, система сворачивает его в короткую заметку с тем, что уже проверено и отброшено, и прикладывает её к следующему запуску.
Где бенчмарки врут, и что с этим делать
В приложении к статье авторы описывают случай, когда их агент получил ноль — хотя был прав. Вопрос в BrowseComp-ZH касался сериала «Игра престолов». Агент ответил «Болтон», эталонный ответ — «Ланнистер». Речь о Сансе Старк: во втором браке она действительно выходит за Рамси Болтона. Агент был прав, бенчмарк — нет.
Команда говорит, что подобные противоречия между эталонными ответами и первоисточниками мотивируют их работать над более надёжными инструментами оценки. Конкретных деталей о том, как именно они планируют это делать, в статье пока нет.
Кому это реально нужно
Iris-mini с 3B активными параметрами — реалистичный вариант для команд, которые хотят развернуть поискового агента локально или в закрытом контуре без зависимости от внешних API. Iris-pro интереснее исследователям и компаниям с серьёзной инфраструктурой: 17B активных параметров при 397B общих — это MoE-архитектура (Mixture of Experts), где в каждый момент работает только часть весов.
Оба агента и полный рецепт обучения опубликованы на GitHub в репозитории AllSpark-Research/Iris. Веса доступны на Hugging Face.



