Anthropic раскрыла результаты Claude Fable 5.1 и Mythos 5.1 в Terminal-Bench 4.0. В её тестировании Mythos решила 60,9% задач, Fable — 55,8%. Для сравнения, Claude Opus 5 получила 52,3%, а Fable 5 — 42,0%. Бенчмарк включает 66 заданий для работы в терминале: от инженерных расчётов до программирования. Все четыре модели запускались через Claude Code в режиме --bare с максимальным усилием рассуждения.
Для Mythos 5.1 выполнили десять повторов каждого задания, для остальных моделей — пятнадцать. Anthropic оценивает стандартную ошибку в 1,6–2 процентных пункта. Компания также поясняет, что Fable и Mythos используют одну базовую модель, но разные защитные ограничения. Поэтому разрыв между ними нельзя свести только к способности решать задачи. Числа на графике относятся к конкретной конфигурации Anthropic; результаты других запусков и публичной таблицы лидеров могут отличаться.