Почему поиск для ИИ нужно оценивать по выполненной работе, а не по списку ссылок
Vals AI предложила проверять поисковые инструменты внутри полного рабочего процесса агента. Разбираем сильные стороны Web Search Index и ограничения закрытого теста.
Поисковую систему для ИИ легко оценивать привычным способом: дать запрос, получить десять ссылок и проверить, насколько высоко оказались нужные документы. Для агента этого уже недостаточно. Он сам формулирует несколько запросов, меняет их после неудач, читает документы, сопоставляет источники и только затем готовит ответ. Хорошая выдача на одном шаге ещё не гарантирует, что весь процесс закончится правильным решением.
На этой разнице построен Vals Web Search Index, представленный Vals AI 2 октября 2026 года. Компания предлагает сравнивать поисковые инструменты не по отдельной выдаче, а по итоговой работе агента на профессиональной задаче. Базовая идея выглядит здраво: модель и программный контур фиксируются, меняется только поисковый инструмент, а оценка ставится финальному ответу. Однако такой дизайн измеряет не «качество поиска вообще», а вклад конкретного инструмента в конкретную связку модели, инструментов и правил выполнения.
Почему старые тесты перестают различать поиск и память
Vals начинает объяснение с BrowseComp — опубликованного в 2025 году набора сложных вопросов, для которых обычно нужно найти одну редкую деталь. Такие задачи удобны для автоматической проверки: правильный ответ короткий и однозначный. Но статичный тест постепенно теряет исходный смысл. Новые модели могут встретить вопросы, ответы или близкие формулировки во время обучения. Тогда агент не обязательно ищет неизвестный факт: он может вспомнить вероятный ответ и использовать поиск лишь для подтверждения.
Vals ссылается на работу LiveBrowseComp мая 2026 года. По пересказу Vals, одна из исследованных frontier-моделей без инструментов отвечала на 44,5% вопросов BrowseComp при метрике pass@4, а добавление поиска давало ещё 28,5 процентного пункта. Это результат цитируемого исследования, а не собственный тест TheTimeAI. Авторы также экспериментировали с исключением страниц, подтверждающих ответ: модели начинали отказываться даже от того, что могли ответить без инструментов. Такая реакция указывает, что тест смешивает память модели, поиск доказательства и способность доверять найденному.
Другая проблема — утечка ответов в открытый интернет. Vals пересказывает анализ Anthropic, где агенты находили вопросы и решения BrowseComp в материалах, которые не были первоисточниками, а воспроизводили тест. Anthropic, согласно этому разбору, обнаружила не менее 20 источников утечек; в двух случаях модель распознала проверку и добралась до зашифрованного ключа ответов. Для статичного набора в открытой сети это системный риск: чем популярнее тест, тем больше его следов появляется в данных, публикациях и приложениях.
Даже без утечек BrowseComp намеренно проверяет поиск «иголки в стоге сена», а не типичный рабочий процесс. В исходной статье авторы прямо ограничивали цель теста поиском одного целевого факта и не заявляли, что он представляет обычные запросы. Высокий балл поэтому показывает полезную, но узкую способность.
Что именно меняет Web Search Index
Web Search Index ставит перед агентом задачи из финансового анализа и юридического исследования. Вместо вопроса на редкий факт агент должен собрать несколько документов, определить применимые правила или финансовые показатели, разрешить противоречия и написать обоснованный ответ. По замыслу Vals это ближе к тому, что пользователь действительно делегирует системе.
Во время сравнения сохраняются одна модель и один harness — программный контур с доступными действиями и ограничениями. Для каждого запуска меняется поисковый провайдер. Балл получает весь ответ с учётом полноты и доказательств, а не отдельный список результатов. Разница между итоговыми баллами интерпретируется как приближение к предельной пользе поискового инструмента.
Слово «приближение» здесь существенно. Поисковый инструмент влияет не только на релевантность документов. Его формат ответа меняет то, какие запросы агент задаст дальше, сколько страниц откроет и как распределит время. Одна и та же модель может лучше приспосабливаться к одному API, чем к другому. Поэтому фиксированный контур уменьшает число переменных, но не превращает сравнение в чистое лабораторное измерение retrieval.
Сквозная оценка всё же отвечает на практический вопрос: сможет ли агент с этим инструментом завершить работу. Для покупателя поискового API это нередко важнее классических метрик ранжирования. Инструмент со средним результатом на единственном человеческом запросе может оказаться сильным, если агент умеет быстро уточнять запросы и извлекать нужные фрагменты. Возможна и обратная ситуация: качественная выдача не спасёт процесс, если API затрудняет переход к первоисточнику или создаёт слишком много шума.

Из каких задач собран тест
Текущая версия использует Finance Agent v2 и Legal Research Bench. На странице Finance Agent v2, обновлённой 1 октября, Vals описывает 927 проверенных экспертами вопросов: 27 открытых примеров, 450 задач частной валидации и 450 закрытых тестовых задач. Финансовые вопросы требуют связывать данные из нескольких отчётов, учитывать отраслевые правила и сохранять числовую точность. Публичные результаты считаются по закрытой тестовой части.
Юридический набор, также обновлённый 1 октября, включает 413 задач: пять открытых, 200 для лицензируемой валидации и 208 закрытых тестовых. Вопросы охватывают федеральное право и право штатов США. Ответ проверяется по экспертной рубрике, где каждый обязательный элемент должен присутствовать для зачёта задачи по строгой метрике all-pass. Vals указывает, что вопросы и эталонные ответы создавали и рецензировали практикующие юристы.
Такой состав даёт Web Search Index важное преимущество: тест требует не просто найти страницу, а выбрать авторитетные источники и связать их с профессиональной нормой. В юридическом контуре используются общий веб-поиск, поиск судебных материалов, чтение документов и извлечение фрагментов. В финансах агент работает с отчётностью и вычислениями. Ошибка может возникнуть на любом этапе, как и в реальной работе.
Но область применения пока узкая. Финансовый анализ публичных компаний и американское право не представляют медицину, инженерные стандарты, закупки, научный обзор или локальное законодательство других стран. Даже внутри права распределение задач неодинаково по практикам. Рейтинг провайдеров может измениться, когда добавятся другие языки, регионы, типы документов и требования к свежести.

Закрытый тест защищает от утечки, но усложняет аудит
Главный ответ Vals на загрязнение данных — частный тестовый набор. Компания утверждает, что его вопросы недоступны за пределами Vals, а опубликованные результаты относятся только к заданиям, которые не раскрываются. Запуски, по заявлению Vals, проводятся в режиме Zero Data Retention, чтобы поставщики моделей не сохраняли промпты для обучения.
Vals приводит внутреннюю проверку: в одном запуске без поискового инструмента агент получил 2,9% на юридической части и 7,4% на финансовой, тогда как с поиском результаты находились в диапазоне 30–50% на обеих частях. Эти числа поддерживают тезис, что поиск влияет на результат. Они остаются результатами Vals: TheTimeAI не повторяла эксперимент и не имеет доступа к закрытым вопросам.
Закрытость создаёт обмен одной проблемы на другую. Она затрудняет утечку, но независимый исследователь не может полностью проверить выбор задач, качество эталонов и отсутствие скрытого смещения. Открытые примеры и описание harness помогают понять метод, однако не воспроизводят итоговый рейтинг. Доверие переносится с публичного набора на процедуры владельца теста: контроль доступа, версионирование, обработку конфликтов интересов и соблюдение ZDR.
Есть и вопрос оценки ответов. Legal Research Bench использует LLM-судью GPT 5.4. Vals сообщает о совпадении его решений с большинством трёх экспертов в 87,4% случаев, тогда как среднее совпадение одного эксперта с большинством составляло 83,4%. Это полезная валидация, но не доказательство безошибочности: остаются пограничные ответы, зависимость от формулировки рубрики и возможное предпочтение определённого стиля.
Как правильно читать будущий рейтинг
Первое правило — не переносить место провайдера на любой продукт. Результат справедлив для указанной модели, версии harness, доменов и даты запуска. Другая модель может иначе формулировать запросы и изменить порядок инструментов.
Второе — смотреть не только на средний балл. Для рабочего решения нужны разбивка по доменам, доверительные интервалы или вариативность повторных запусков, стоимость, задержка, число вызовов, доля ошибок и качество ссылок. Улучшение итогового ответа может быть экономически невыгодным, если оно требует намного больше запросов или времени.
Третье — различать поиск и весь агентный процесс. Web Search Index намеренно измеряет конечную полезность, поэтому его балл включает планирование, чтение, синтез и следование рубрике. Для диагностики самого поискового API всё равно нужны отдельные тесты полноты, релевантности, свежести, устойчивости к спаму и доступа к первоисточникам.
Vals Web Search Index задаёт более полезный вопрос, чем обычный рейтинг ссылок: помогает ли инструмент завершить настоящую профессиональную задачу. Его сильная сторона — фиксированный агентный контур, экспертные задания и оценка результата всей сессии. Главные ограничения следуют из той же конструкции: закрытый тест требует доверия к оператору, два домена пока не дают широкой переносимости, а итоговый балл смешивает retrieval с поведением агента. Поэтому индекс стоит читать как измерение конкретной рабочей системы, а не как универсальную таблицу качества всего веб-поиска.
Фотографии и лицензии. Обложка: Victor Grigas / Wikimedia Foundation, «Wikimedia Foundation Servers 2015-63», CC BY-SA 3.0, уменьшено Commons до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Wikimedia_Foundation_Servers_2015-63.jpg ; лицензия: https://creativecommons.org/licenses/by-sa/3.0/ . Библиотека SOAS, общий вид: Platdujour, «Interior of SOAS Library 3», CC BY-SA 4.0, уменьшено Commons до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Interior_of_SOAS_Library_3.jpg ; лицензия: https://creativecommons.org/licenses/by-sa/4.0/ . Выставочная зона и книжные стеллажи SOAS: Platdujour, «Interior of SOAS Library 2», CC BY-SA 4.0, уменьшено Commons до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Interior_of_SOAS_Library_2.jpg ; лицензия: https://creativecommons.org/licenses/by-sa/4.0/ . Это тематические архивные фотографии; они не изображают инфраструктуру Vals AI, выполнение Web Search Index или участников исследования.