AWS представила Agent Evaluation Metric (AEM) — способ оценивать качество многоходовых диалогов по отдельным ходам, а не только по итоговому результату. В первой публикации метрика применена к корректности и раскладывает её на два показателя: полноту ответа и соответствие фактам. Для действий агента тот же подход проверяет наличие нужных параметров и правильность их значений.

AEM помечает ход как пройденный или непройденный, а затем объединяет результаты в долю успешных ходов. Отдельная классификация отличает исходную ошибку от последующих сбоев, унаследованных от неё. Например, неверный параметр в одном вызове инструмента может испортить несколько следующих ходов; метрика связывает их с первопричиной через метку prior_action_failed.

Для сравнения текстов AWS предлагает семантическую проверку с embedding-моделью или LLM-as-judge и настраиваемым порогом. Методика подключается к Strands Agents evaluation SDK как custom evaluator. В примере с Amazon Quick Suite AWS использует учебный диалог и не приводит внутренних производственных показателей. Это описание методики производителя, а не независимое исследование качества агентов.