Команда vLLM опубликовала технический разбор оптимизации MiniMax M3 на ускорителях AMD Instinct MI355X. Авторы описывают, как после первого запуска реализации анализировали узкие места выполнения: форму вычислений, повторяющуюся работу, перемещение данных, запуск быстрых путей и рост очереди.

В материале приведены результаты фиксированной рабочей нагрузки и отдельные этапы оптимизации. vLLM связывает разбор с публичными результатами бенчмарка SemiAnalysis InferenceX, а также описывает EAGLE3 как дополнительный цикл декодирования. Авторы подчёркивают, что производительность меняется вместе с найденным узким местом, поэтому один итоговый показатель не заменяет диагностику конкретной конфигурации.

Публикация содержит инструкции для воспроизведения фиксированного результата и перечень параметров, которые нужно проверять при следующей оптимизации. В тексте отдельно обсуждаются форма тензоров, повторное выполнение и передача данных между этапами; эти детали нужны для переноса метода на другой запуск. Это отчёт авторов vLLM о технической работе, а не независимый тест MiniMax M3 и не универсальный рейтинг ускорителей.