NVIDIA опубликовала предварительные результаты Vera Rubin NVL72 в наборе тестов MLPerf Inference 6.1. По данным компании, система обеспечила до 3,7 раза больший throughput, то есть объём обработанных запросов за единицу времени, чем GB300 NVL72 на модели Qwen3-VL. На DeepSeek-R1 преимущество достигло 2,5 раза. Для Qwen3-VL использовались vLLM и открытый фреймворк NVIDIA Dynamo, для DeepSeek-R1 — библиотека TensorRT-LLM.
В конфигурации Vera Rubin вычисления начальной обработки запроса и последующей генерации токенов разделялись между ресурсами. Компания также применяла параллельную обработку экспертов в моделях типа mixture-of-experts. NVIDIA связывает результаты с новыми Tensor Cores, Transformer Engine, форматом NVFP4 и межсоединением NVLink шестого поколения.
Отдельная заявка проверяла масштабирование GB300 NVL72. Четыре стойки с 288 GPU показали 99% эффективности относительно одной стойки в офлайн-сценарии DeepSeek-R1: производительность росла почти пропорционально числу ускорителей. В версии 6.1 результат GB300 NVL72 на Qwen3-VL также вырос до 1,6 раза по сравнению с версией 6.0; NVIDIA объясняет это оптимизациями программного стека.
Сравнения Vera Rubin являются preview-результатами в конкретных конфигурациях NVIDIA и не означают такого же ускорения во всех нагрузках. Компания ссылается на записи MLPerf 6.1-0106 и 6.1-0074. Дополнительные измерения после срока подачи, включая GPT-OSS-120B, MLCommons ещё не проверяла.