IBM Research рассказала об эксперименте с системой llm-d, проведённом совместно с Red Hat. Команда запустила модель GLM-5.2 на кластере из 544 ускорителей NVIDIA H100 и исследовала обслуживание множества параллельных запросов от агентов. В публикации рассматривается, как эффективнее использовать уже установленное оборудование при работе с большой моделью, использующей архитектуру смеси экспертов.
Система сохраняет результаты обработки повторяющихся частей запросов и направляет новые обращения туда, где нужные данные уже доступны. Дополнительно она разделяет первоначальное чтение контекста и последующую генерацию ответа между разными группами ресурсов. Часть кеша можно размещать в памяти центральных процессоров и передавать между узлами. Приведённые показатели относятся к описанным нагрузкам и конфигурации эксперимента: публикация не устанавливает универсальную скорость для любого приложения на H100.