Perplexity представила Q2D-Web — бенчмарк для проверки поисковых моделей в агентных RAG-системах. Он оценивает первый этап поиска: способен ли ретривер найти нужные источники до последующих этапов переранжирования и формирования ответа.
В основе Q2D-Web — корпус из 190 млн веб-документов и 69 721 агентно переформулированный поисковый запрос на десяти языках. Авторы подготовили бенчмарк на материале примерно 23 тыс. поисковых сессий в рабочей системе, собранных за девять месяцев. Корпус сформировали из результатов производственного поиска и после объединения и дедупликации получили около 190 млн документов.
Читайте также: 5 лучших нейросетей для работы
Что проверяет Q2D-Web
В агентном поиске пользовательский вопрос обычно превращается в несколько вспомогательных запросов. Их составляет агент с учётом исходного сообщения, предыдущего диалога и уже найденных материалов. Затем ретривер отбирает документы для следующих этапов — переранжирования и подготовки ответа.
Q2D-Web проверяет именно этот первый отбор. Основная метрика — Recall@1000: она показывает, какая доля подходящих документов попала в первую тысячу результатов. Авторы также используют Recall@100 и nDCG@10.
Из 69 721 запроса 12 365 относятся к основным, а 57 356 — к вспомогательным. В среднем на один основной запрос приходится около четырёх вспомогательных. Запросы с персональными данными исключили.
Как устроена оценка
Для проверки релевантности авторы использовали три набора данных. В первый вошли документы, на которые ссылались ИИ-агенты. Во второй — результаты производственного веб-поиска. Третий объединяет эти данные и добавляет оценки языковой модели для документов, которые раньше не получили метку.
Исследователи сравнили 13 ретриверов: лексические, плотные и модели позднего взаимодействия. Результаты зависят от темы, языка и типа запроса. Например, BM25 показал самый низкий общий Recall@1000, но нашёл больше уникальных релевантных документов, пропущенных другими системами.
Корпус, запросы и оценки Q2D-Web не публикуются, чтобы снизить риск попадания тестовых данных в обучение моделей. Проверить открытые ретриверы можно через публичный рейтинг на Hugging Face. Бенчмарк оценивает только поиск источников, а не качество итогового ответа агента.
При этом лидер зависит от выбранной метрики: в объединённом наборе разметки pplx-embed-v1-4b показал лучший результат по Recall@1000, а Nemotron-3-Embed-8B — по Recall@100 и nDCG@10.
Ранее Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer.
Изображения: arxiv.org, huggingface.co









