Тесты ИИ
Legora сообщила о приросте GPT-6 Astra в проверке отчётности
В отдельном сценарии бенчмарка BAR улучшение приблизилось к 40%, а в среднем по всем заданиям составило около 3%.
OpenAIНовости искусственного интеллекта
Тесты моделей ИИ: результаты бенчмарков, метрики и условия сравнения.
В отдельном сценарии бенчмарка BAR улучшение приблизилось к 40%, а в среднем по всем заданиям составило около 3%.
OpenAIOpenAI опубликовала результаты с поправкой на длину ответа. В том же сравнении GPT-5.6 Sol получила 60,5 балла.
OpenAIMythos получила 60,9%, Fable — 55,8%. В системной карте указаны число повторов, настройки и погрешность измерений.
Anthropic