AWS добавила модельное кеширование для инференса в Amazon SageMaker HyperPod. Функция заранее загружает веса моделей на локальное NVMe и предварительно подтягивает образы серверов контейнеров на узлы кластера. Когда запускается новый под, он может читать данные с локального накопителя, а не ждать повторной загрузки по сети из Amazon S3, Amazon FSx for Lustre, Hugging Face Hub или SageMaker JumpStart.

По описанию AWS, локальное чтение идёт примерно со скоростью 7 ГБ/с. Поэтому поды с уже подготовленным кешем обычно начинают обслуживать запросы за секунды вместо десятков минут. Компания приводит пример модели DeepSeek-R1 объёмом более 600 ГБ: без кеша её загрузка может занимать свыше 30 минут. Для образов контейнеров AWS указывает экономию пяти–семи минут на скачивании.

Кеш весов готовится отдельно для каждого узла и сначала всё равно требует сетевой загрузки. Объём NVMe должен вместить модель, а обновление файлов по тому же пути S3 само по себе не обновляет кеш. При нехватке подготовленных узлов система возвращается к обычной загрузке. AWS также сообщает о сокращении времени масштабирования примерно на 60% на моделях 57–145 ГБ, но это результат тестов производителя, а не независимое измерение.