Команда AGI NLP & Computer Operator из Сбера выпустила открытый бенчмарк WebPageBench — среду для оценки веб-агентов на шести имитациях популярных русскоязычных сервисов. Главное отличие от конкурентов: успех агента проверяется не моделью-судьёй и не его собственным отчётом «готово», а журналом событий, который сайт пишет сам. Код, задачи, препринт на arXiv и публичная таблица лидеров на Hugging Face уже доступны.
Почему тестировать агентов на живых сайтах не работает
Сайты меняются — интерфейс обновился, и вчерашняя задача сегодня не воспроизводится. Защита от ботов отрезает часть прогонов ещё до загрузки первой страницы. Сценарии с корзиной или оплатой на боевом сервисе — это реальные заказы, которые никто не готов гонять в цикле сотни раз.
Главная проблема глубже: на живом сайте нет объективного способа понять, что агент на самом деле сделал. Либо доверяешь его словам, либо ставишь сверху LLM-судью — а у того свои ошибки и свои галлюцинации.
Существующие бенчмарки решают это по-разному: сравнивают траекторию с человеческой, поднимают копии сайтов и смотрят на конечное состояние. Но ни один из них, по словам команды, не отвечает на два конкретных вопроса: агент заявил «сделал» — он действительно сделал? И если провалил задачу — не понял инструкцию или не справился с конкретным элементом управления вроде календаря?
Отдельный момент: почти все известные бенчмарки построены на англоязычных сайтах, тогда как агенты Сбера работают с русскоязычным интерфейсом.
Что внутри: три компонента и шесть сайтов-имитаций
WebPageBench состоит из трёх частей.
Среда — шесть русскоязычных сайтов-имитаций под общим хабом: Маркет (маркетплейс, 42 товара), Книги (книги и аудиокниги, 226 позиций с синтетическими именами авторов и названиями), Продукты (доставка, 277 товаров), Поезда (ЖД-билеты с выбором места, тарифа и оплатой), Отели и Файлы (кабинет с реальными PDF и CSV). Логотипов и названий реальных сервисов нет — маршруты нейтральные (bench_catalog_main, bench_hotel_search), чтобы модель не угадывала сайт по адресу.
Задачи — 152 задания: 65 написанных вручную сценариев и 87 вариаций, где та же задача решается через другую реализацию того же элемента управления или в тёмной теме. Это позволяет отделить «не понял задание» от «не справился с конкретным календарём».
Запуск и рейтинг — скрипты, которые прогоняют любую поддерживаемую обвязку по всем задачам за одну команду. В публичной таблице сейчас 24 связки «модель + обвязка»: среди них browser-use, OpenManus, OpenHands для DOM-агентов и UI-TARS, OpenCUA, Fara для GUI-моделей, работающих со скриншотами.
Как проверяется результат без судьи
Каждый запуск задачи — изолированная траектория: отдельный экземпляр сайта со своим адресом, состоянием и журналом. Параллельные прогоны одной задачи друг друга не видят.
Всё, что происходит на странице, сайт записывает в лог в виде типизированных событий — имя события плюс словарь параметров. basket_add хранит идентификатор товара и количество, select_tariff — название тарифа, bench_hotel_select_city — идентификатор города, его название и страну. Событий семантических типов 19; низкоуровневые click, keypress и scroll тоже сохраняются, но условия задач проверяются только по семантическим.
По завершении прогона функция check() сверяет лог с условиями задачи. Заявка агента «готово» хранится отдельно от вердикта — это принципиально: система не верит агенту на слово.
Кому это нужно прямо сейчас
Бенчмарк закрывает конкретную нишу: команды, которые разрабатывают или дообучают веб-агентов для русскоязычной аудитории, раньше не имели стандартизированной среды с объективной проверкой. Теперь можно сравнивать DOM-агентов и GUI-моделей в одних условиях и понимать, где именно агент ломается — на логике задачи или на конкретном виджете.
Для исследователей важна воспроизводимость: среда разворачивается локально, сайты детерминированы, данные синтетические. Один и тот же элемент управления можно нарисовать несколькими способами и прогнать задачу через разные реализации — это даёт возможность изолировать влияние конкретного UI-компонента на результат.
Где это пока не работает и чего в источнике нет
Бенчмарк покрывает шесть типов сайтов — это конкретная выборка, а не репрезентативный срез всего русскоязычного веба. Насколько результаты переносятся на другие категории сервисов, из препринта не следует.
152 задачи — разумный объём для старта, но для статистически устойчивых выводов о разрыве между моделями этого может оказаться мало, особенно если агенты начнут показывать высокие результаты и различия сожмутся.
Команда не раскрывает, какие именно реальные сервисы послужили основой для имитаций. Это объяснимо с точки зрения анонимизации, но затрудняет оценку того, насколько моки точно воспроизводят оригинальный UX.
Наконец, бенчмарк проверяет факт выполнения действия по логу, но не оценивает качество пути — агент может прийти к правильному результату неоптимальным маршрутом, и это не отразится в метрике.

