Legora проверила GPT-6 Astra на своём Benchmark for Agentic Reasoning — наборе юридических задач. По данным компании, опубликованным OpenAI, результат в сценарии сверки финансовой отчётности вырос почти на 40% относительно предыдущей модели. Средний прирост по всем заданиям BAR был заметно скромнее — около 3%. В публикации не названо, с какой именно предыдущей моделью проводилось это сравнение.
В отдельном описанном запуске агент обработал 41 документ и нашёл все четыре заранее внесённые ошибки, в том числе расхождение на 500 тысяч фунтов. Legora сообщает, что проверка заняла минуты, а её результаты оставались на рассмотрение специалиста. Эти цифры описывают конкретный рабочий процесс. Они не означают, что Astra стала на 40% точнее во всех юридических задачах. Для такого вывода нужны подробности выборки и повторяемые независимые испытания.