OpenAI опубликовала в системной карте GPT-6 Astra результаты медицинских бенчмарков. В HealthBench Professional модель получила 63,4 балла против 60,5 у GPT-5.6 Sol. В более сложной версии HealthBench Hard результаты составили 36,3 и 33,1 балла соответственно. Эти значения приведены по шкале от 0 до 100 с поправкой на длину ответа. Они не означают долю правильных диагнозов или успешных лечений.
Поправка важна для сравнения: развёрнутый ответ может набрать больше баллов за перечисление деталей, даже когда он не становится полезнее. OpenAI снижает оценку за избыточную длину. В HealthBench Professional средний ответ Astra занимал 4097 символов, а Sol — 3228. Без поправки их оценки составляли 69,5 и 64,1. Это измерения разработчика в заданных условиях теста; сами по себе они не подтверждают качество модели в клинической практике.