AWS добавила в Amazon SageMaker Inference стратегию prefix-aware routing для запросов к большим языковым моделям. Она анализирует начало запроса и направляет обращения с одинаковым префиксом на один экземпляр endpoint. Благодаря этому вычисленный KV-кэш общего контекста остаётся на месте и может использоваться повторно, вместо того чтобы заново строиться на разных машинах.
В описании AWS указано, что стратегия сама распределяет разные префиксы между экземплярами, а при перегрузке целевого экземпляра отправляет запрос на менее занятый. При изменении размера кластера большая часть запросов сохраняет прежнюю привязку. Настройка задаётся в конфигурации endpoint; для неё предусмотрены параметры PrefixLength и ConcurrencyThreshold. Менять контейнер модели не требуется, но в serving-фреймворке должен быть включён prefix caching.
Максимумы из теста AWS с длинным общим контекстом: при 8 000-токенных префиксах и нагрузке в течение часа на Llama 3.1 70B Instruct с vLLM и включённым prefix caching, на семи ml.p5.48xlarge, P50 time-to-first-token снизился на 77%, а пропускная способность выросла на 16%. Это результат условий и нагрузки из теста производителя, а не независимое измерение. AWS также указала дополнительную задержку маршрутизации 1,3–1,9 мс на запрос.