AWS и Qumulo опубликовали результаты проверки обучения модели, при котором вычисления и единственная копия набора данных находились в разных регионах AWS. Кластер SageMaker HyperPod в Орегоне читал данные из Огайо через Qumulo Cloud Data Fabric при сетевой задержке около 60 мс. После прогрева удалённая конфигурация достигла 115–117 образцов в секунду — уровня кластера, размещённого рядом с данными.
В тесте использовалась модель LLaMA v3 на 1,02 млрд параметров, набор C4 с 48,4 млн последовательностей, PyTorch 2.1 FSDP и два экземпляра ml.p5.48xlarge на кластер — всего 16 ускорителей H100. В первые 100–150 пакетов удалённый запуск работал медленнее: скорость составляла 95–105 образцов в секунду, а загрузка GPU — 80–90%. После обучения предиктивного кэша NeuralCache 94–96% чтений обслуживались с локальных NVMe-накопителей с задержкой менее 5 мс; загрузка GPU выросла до 98–100%.
Архитектура оставляет исходные данные в одном регионе. Локальный узел Qumulo в регионе вычислений предоставляет тот же POSIX-путь, а недостающие блоки получает через VPC peering. Поэтому код задания между кластерами менять не пришлось.
Это измерения AWS и Qumulo, а не независимый тест. Они относятся к указанной последовательной схеме чтения, размеру пакета 24 на GPU и конкретной инфраструктуре. Сами авторы предупреждают, что результат зависит от набора данных, шаблона доступа и сети. Кроме того, развёртывание ресурсов в двух регионах создаёт расходы, пока инфраструктура не удалена.