Amazon Web Services описала отказоустойчивую схему распределённого обучения на Amazon EKS с NVIDIA Resiliency Extension, или NVRx, и PyTorch Fully Sharded Data Parallel. Реализация сочетает асинхронные контрольные точки, перезапуск процесса внутри контейнера и восстановление рабочих процессов через ft_launcher. AWS также опубликовала код для воспроизведения конфигурации.
Проверки компании охватывали кластеры от двух до восьми узлов с графическими ускорителями NVIDIA H100, то есть от 16 до 64 GPU. При сохранении контрольных точек раз в 1000 шагов асинхронная запись обеспечила более 99% эффективности обучения. При интервале 100 шагов на восьми узлах показатель снизился до 29,6% против 14,7% у синхронной записи. Под эффективностью авторы понимают долю времени, когда система продолжала вычисления, а не ждала завершения записи состояния.
В отдельном тесте на двух узлах с 16 H100 обучали Llama-3.1-8B и вносили пять искусственных сбоев. Восстановление внутри живого Python-процесса занимало примерно 10 секунд. Для описанной базовой схемы с каскадом отказа Kubernetes AWS указывает более четырёх минут. Разница связана с тем, что NVRx может определить проблему и перезапустить рабочий процесс без полного пересоздания задания и инфраструктуры, если характер сбоя это позволяет.
Все цифры получены AWS в конкретной конфигурации и не являются универсальной гарантией для EKS или NVRx. Результат зависит от числа узлов, сети, хранилища, размера модели, частоты контрольных точек и типа отказа. Командам потребуется повторить тесты на собственной нагрузке и отдельно проверить сценарии, в которых повреждён узел или инфраструктура не позволяют восстановиться внутри того же контейнера.