Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

На русском языке
Со ссылками на источники
Все статьи
Статьи/ Тесты ИИ

Как читать бенчмарки ИИ: что стоит за баллом в таблице

Как отличить качество модели от условий испытания, прочитать временной горизонт и выбрать проверки для собственной работы.

Как читать бенчмарки ИИ: что стоит за баллом в таблице
Фото: imgix

7 сентября 2026 года Artificial Analysis представила Intelligence Index v4.3: обновила Terminal-Bench до версии 4 и заменила банковский тест на AutomationBench-AA. В последнем общий Score допускает частичный результат, тогда как Tasks Completed учитывает полностью завершённые задания; нарушение защитного ограничения обнуляет оценку задания. Уже эти два показателя объясняют, почему слово «успех» под столбиком требует расшифровки. Новая таблица даёт повод разобраться, что именно мы сравниваем, когда выбираем ИИ по бенчмаркам.

На картинке из презентации всё выглядит убедительно: название модели, несколько цветных столбиков, жирный лучший результат. Но между этим результатом и вопросом «поможет ли модель в моей работе?» остаётся расстояние. Бенчмарк измеряет выполнение определённых заданий по определённым правилам. Чтобы понять его пользу, нужно сначала восстановить эти правила, а уже потом сравнивать числа.

Представим обычную задачу: редакции нужен помощник, который собирает справки по нескольким документам. Ей важны точные имена, проверяемые ссылки и умение заметить противоречие. Победа модели в программировании может оказаться интересной новостью, но сама по себе не отвечает ни на один из этих вопросов. Нужен перевод с языка общего рейтинга на язык конкретной работы. Сделать его можно без собственной исследовательской лаборатории.

Начните с того, что считали успехом

В январском разборе оценок агентов Anthropic отделяет финальный результат от рассказа агента о результате. Сообщение о бронировании ещё не означает, что бронь появилась в системе. Там же различаются pass@k — успех хотя бы в одной из нескольких попыток — и pass^k, требующая успешности всех попыток. Это ответы на разные вопросы. Для поиска решения допустимо перебрать варианты; для регулярно выполняемой операции особенно важна повторяемость. Источник: Anthropic, «Demystifying evals for AI agents», 9 января 2026 года.

Для читателя полезно мысленно заменить абстрактное «решено» наблюдаемым действием. Справка содержит нужный факт? Ссылка ведёт именно к подтверждающему абзацу? Файл действительно сохранён? Затем выяснить, кто это проверял: программа, другая модель или человек. Наличие автоматической оценки удобно, однако из него не следует, что критерий охватывает все свойства хорошего ответа. Если тест ищет совпадение строки, полезное объяснение может не получить балл. Если оценивается красивый ответ, за ним может скрываться несделанная работа.

Три критерия: хотя бы один успех, успех во всех попытках и реальное состояние среды.
Редакционная схема TheTimeAI по определениям Anthropic. Условные связи; численных измерений нет.
Открыть крупнее

Один итоговый балл скрывает разные качества

Stanford CRFM заложил в HELM идею многомерной оценки: наряду с точностью рассматривать калибровку, устойчивость, справедливость, смещения, токсичность и эффективность. В исходной работе также прямо обозначались непокрытые области, включая языки за пределами английского. Это историческое описание версии HELM 2022 года, а не характеристика всех сегодняшних таблиц проекта. Его полезный принцип сохраняется: неполнота измерений должна быть видимой. Источник: Stanford CRFM, «Language Models are Changing AI: The Need for Holistic Evaluation».

Для русскоязычной редакции отсюда возникает самостоятельный план проверки. Помимо точного извлечения фактов, стоит посмотреть, как система обращается с русскими фамилиями, аббревиатурами и неоднозначными датами. Хорошая английская справка ещё не показывает, насколько аккуратно будет написана русская. И даже безошибочная справка может оказаться непригодной по форме, если специалисту приходится заново собирать её из длинных отступлений. Итоговый балл лучше раскрывать на отдельные свойства, по которым предстоит принимать решение.

У агента есть среда, и она влияет на результат

5 февраля 2026 года Anthropic описала внутренние эксперименты с Terminal-Bench 2.0: разница между крайними конфигурациями ресурсов достигла шести процентных пунктов. При этом сохранялись модель, набор задач и агентная оболочка. Дополнительная память сначала уменьшала число инфраструктурных сбоев, а при более щедрых лимитах позволяла применять ресурсоёмкие способы решения. Авторы сообщили о том же направлении эффекта в проверке SWE-bench, но с меньшей величиной. Это исследование самой Anthropic; универсальную поправку для всех моделей оно не устанавливает.

Если в таблице сравнивают агентов, ищите описание доступной памяти, процессора, времени и инструментов. Одинаковое название модели не гарантирует одинакового испытания. Один запуск мог использовать поиск, другой — только предоставленный текст. Один мог повторять попытки после ошибки, другой прекращал работу. Поэтому корректнее записывать результат вместе с конфигурацией. Отсутствие этих подробностей не доказывает недобросовестности автора, но ограничивает выводы стороннего читателя. Источник: Anthropic, «Quantifying infrastructure noise in agentic coding evals».

Модель, среда, попытка и проверка вместе образуют конфигурацию испытания агента.
Редакционная схема TheTimeAI. Ресурсы среды — часть условий испытания; по материалам Anthropic от 5 февраля 2026 года.
Открыть крупнее

Часы на графике не всегда означают время работы ИИ

Особенно легко неправильно прочитать временной горизонт METR. В заметке от 22 января 2026 года исследователь Томас Ква уточняет: 50-процентный горизонт характеризует длительность задач для человека, на которых ожидаемая успешность системы составляет половину. Это не продолжительность непрерывной автономной работы модели. Автор также предупреждает о различиях между областями, неопределённости оценок и невозможности прямо превратить рост горизонта в рост производительности работников. Источник: METR, «Clarifying limitations of time horizon».

В рабочем разговоре эти различия меняют смысл обещания. Фраза «агент справляется с задачами определённой сложности» оставляет место для проверки и неудач. Фраза «агент может столько времени работать без надзора» приписывает измерению то, чего оно не устанавливает. Если вы выбираете процесс для автоматизации, отдельно оцените время постановки задачи, ожидания, проверки и исправления. Пользователю важен весь путь до принятого результата, включая собственную работу после ответа модели. График сложности задач этот путь полностью не описывает.

Уточнения методики могут менять числа

В мартовской заметке METR о модельных предположениях разобрано, как на временной горизонт влияют статистическая модель и состав заданий. Исправление ошибки регуляризации снизило некоторые тогдашние оценки временного горизонта при 50-процентной вероятности успеха на величину до 20%. Автор подчёркивает широкие доверительные интервалы и считает распределение задач главным источником неопределённости. Это уточнение конкретной методики, а не основание объявлять все измерения ИИ бессмысленными. Источник: Александр Барри, METR, «Impact of modelling assumptions on time horizon results», 20 марта 2026 года.

Поэтому скриншот без даты быстро теряет ценность. Лучше сохранить ссылку, версию теста и пояснение к шкале. При следующем сравнении проверьте, не пересчитаны ли старые результаты. Если интервалы не показаны, не дорисовывайте их из общих рассуждений о случайности. А если показаны, не превращайте небольшое различие точечных оценок в категорическую победу. Честная формулировка иногда звучит скромнее заголовка: в данном запуске система получила больше баллов, но устойчивость преимущества из опубликованных данных не ясна.

Скорость системы — отдельное измерение

MLCommons описывает MLPerf Inference: Datacenter как измерение скорости обработки входов и получения результатов обученной моделью. При этом сценарии, требования к качеству и правила сравнения имеют значение. В Closed используются те же модели, что в эталонной реализации; Open допускает иной выбор или переобучение. Это различие необходимо прочитать прежде, чем сопоставлять строки. Страница также указывает, что опубликованные результаты иногда изменяются или признаются недействительными, и отсылает к журналу изменений. Источник: MLCommons, «MLPerf Inference: Datacenter», проверено 9 сентября 2026 года.

Для редакционного помощника скорость появления первых слов и время получения готовой справки могут ощущаться совершенно по-разному. Быстро начатый ответ способен долго дописываться; высокая пропускная способность полезна при большой очереди запросов, но не обязательно означает комфортное ожидание одного человека. К измерению качества добавьте собственный сценарий нагрузки. Не объединяйте скорость, точность и цену в один самодельный рейтинг, пока не объяснили, какой вес каждому свойству придаёт ваша задача.

Как превратить таблицу в рабочее решение

Вернёмся к редакции. Ей можно собрать небольшой закрытый набор реальных, разрешённых к использованию документов: простой случай, разногласие источников, исправленный документ и вопрос, ответа на который в материалах нет. Для каждого заранее записать приемлемый результат. Затем дать сравниваемым системам одинаковые материалы и условия, сохранить ответы и попросить редактора проверить их без подсказки, кто автор. Это предложенный способ прикладной проверки, а не проведённый нами эксперимент.

В такой проверке особенно ценны ошибки, которые можно назвать словами. Перепутана дата. Ссылка не подтверждает утверждение. Ответ получен только после уточнения. Вместо вопроса о единственном победителе появится понимание, какие задачи можно поручать системе и где потребуется человек. Публичные бенчмарки помогают выбрать кандидатов для этой проверки. Окончательный выбор становится обоснованным, когда известны не только сильные результаты, но и условия, в которых они перестают воспроизводиться.

Вернёмся к обновлению Artificial Analysis: сменился не только список результатов, но и состав испытаний. Поэтому разумно сохранить рядом с интересующим баллом название версии индекса и определение показателя. Если таблица изменилась, сначала выясните, поменялась ли измерительная линейка. А затем проверьте собственный сценарий: например, помощник действительно подготовил пригодную справку или лишь выполнил часть действий. Такой вопрос переживёт очередную смену лидера и поможет читать следующий рейтинг без необходимости каждый раз начинать с нуля.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям