Команда AGI NLP & Computer Operator из Сбера выпустила открытый бенчмарк WebPageBench — среду для оценки веб-агентов на шести имитациях популярных русскоязычных сервисов. Главное отличие от конкурентов: успех агента проверяется не моделью-судьёй и не его собственным отчётом «готово», а журналом событий, который сайт пишет сам. Код, задачи, препринт на arXiv и публичная таблица лидеров на Hugging Face уже доступны.

Почему тестировать агентов на живых сайтах не работает

Сайты меняются — интерфейс обновился, и вчерашняя задача сегодня не воспроизводится. Защита от ботов отрезает часть прогонов ещё до загрузки первой страницы. Сценарии с корзиной или оплатой на боевом сервисе — это реальные заказы, которые никто не готов гонять в цикле сотни раз.

Главная проблема глубже: на живом сайте нет объективного способа понять, что агент на самом деле сделал. Либо доверяешь его словам, либо ставишь сверху LLM-судью — а у того свои ошибки и свои галлюцинации.

Существующие бенчмарки решают это по-разному: сравнивают траекторию с человеческой, поднимают копии сайтов и смотрят на конечное состояние. Но ни один из них, по словам команды, не отвечает на два конкретных вопроса: агент заявил «сделал» — он действительно сделал? И если провалил задачу — не понял инструкцию или не справился с конкретным элементом управления вроде календаря?

Отдельный момент: почти все известные бенчмарки построены на англоязычных сайтах, тогда как агенты Сбера работают с русскоязычным интерфейсом.

Что внутри: три компонента и шесть сайтов-имитаций

WebPageBench состоит из трёх частей.

Среда — шесть русскоязычных сайтов-имитаций под общим хабом: Маркет (маркетплейс, 42 товара), Книги (книги и аудиокниги, 226 позиций с синтетическими именами авторов и названиями), Продукты (доставка, 277 товаров), Поезда (ЖД-билеты с выбором места, тарифа и оплатой), Отели и Файлы (кабинет с реальными PDF и CSV). Логотипов и названий реальных сервисов нет — маршруты нейтральные (bench_catalog_main, bench_hotel_search), чтобы модель не угадывала сайт по адресу.

Задачи — 152 задания: 65 написанных вручную сценариев и 87 вариаций, где та же задача решается через другую реализацию того же элемента управления или в тёмной теме. Это позволяет отделить «не понял задание» от «не справился с конкретным календарём».

Запуск и рейтинг — скрипты, которые прогоняют любую поддерживаемую обвязку по всем задачам за одну команду. В публичной таблице сейчас 24 связки «модель + обвязка»: среди них browser-use, OpenManus, OpenHands для DOM-агентов и UI-TARS, OpenCUA, Fara для GUI-моделей, работающих со скриншотами.

Как проверяется результат без судьи

Каждый запуск задачи — изолированная траектория: отдельный экземпляр сайта со своим адресом, состоянием и журналом. Параллельные прогоны одной задачи друг друга не видят.

Всё, что происходит на странице, сайт записывает в лог в виде типизированных событий — имя события плюс словарь параметров. basket_add хранит идентификатор товара и количество, select_tariff — название тарифа, bench_hotel_select_city — идентификатор города, его название и страну. Событий семантических типов 19; низкоуровневые click, keypress и scroll тоже сохраняются, но условия задач проверяются только по семантическим.

По завершении прогона функция check() сверяет лог с условиями задачи. Заявка агента «готово» хранится отдельно от вердикта — это принципиально: система не верит агенту на слово.

Кому это нужно прямо сейчас

Бенчмарк закрывает конкретную нишу: команды, которые разрабатывают или дообучают веб-агентов для русскоязычной аудитории, раньше не имели стандартизированной среды с объективной проверкой. Теперь можно сравнивать DOM-агентов и GUI-моделей в одних условиях и понимать, где именно агент ломается — на логике задачи или на конкретном виджете.

Для исследователей важна воспроизводимость: среда разворачивается локально, сайты детерминированы, данные синтетические. Один и тот же элемент управления можно нарисовать несколькими способами и прогнать задачу через разные реализации — это даёт возможность изолировать влияние конкретного UI-компонента на результат.

Где это пока не работает и чего в источнике нет

Бенчмарк покрывает шесть типов сайтов — это конкретная выборка, а не репрезентативный срез всего русскоязычного веба. Насколько результаты переносятся на другие категории сервисов, из препринта не следует.

152 задачи — разумный объём для старта, но для статистически устойчивых выводов о разрыве между моделями этого может оказаться мало, особенно если агенты начнут показывать высокие результаты и различия сожмутся.

Команда не раскрывает, какие именно реальные сервисы послужили основой для имитаций. Это объяснимо с точки зрения анонимизации, но затрудняет оценку того, насколько моки точно воспроизводят оригинальный UX.

Наконец, бенчмарк проверяет факт выполнения действия по логу, но не оценивает качество пути — агент может прийти к правильному результату неоптимальным маршрутом, и это не отразится в метрике.

Источники