ИИтак

← Назад

Vera Rubin NVL72 в MLPerf: до 3,7 раза быстрее GB300 на Qwen3-VL и в 2,5 раза на DeepSeek-R1

NVIDIA раскрыла подробности первых результатов Vera Rubin NVL72 в тесте MLPerf Inference v6.1. На Qwen3-VL стойка до 3,7 раза производительнее GB300 NVL72, на DeepSeek-R1 — до 2,5 раза. Четыре стойки GB300 масштабируются с эффективностью 99%.

Изображение: NVIDIA

Стойка NVIDIA Vera Rubin NVL72 впервые появилась в отраслевом тесте MLPerf Inference и обошла предшественницу GB300 NVL72. На мультимодальной модели Qwen3-VL у неё до 3,7 раза выше пропускная способность, то есть она выдаёт больше токенов за то же время. На модели рассуждений DeepSeek-R1 разрыв меньше — до 2,5 раза. Результаты поданы как предварительные: NVIDIA тестировала систему только на этих двух моделях.

Цифру 3,7 раза компания уже называла на конференции AI Infra Summit. Теперь NVIDIA объяснила, откуда прирост. Новые тензорные ядра ускоряют обе стадии ответа: чтение запроса и генерацию текста. Формат NVFP4 уменьшает объём памяти под веса модели и кэш и почти не снижает качество ответов. Кроме того, чтение запроса и генерацию выполняли на разных группах видеокарт. Экспертов в моделях со смесью экспертов тоже распределили по множеству чипов. Кроме NVIDIA, результаты Vera Rubin NVL72 подала облачная компания Nebius.

Вторая новость касается масштабирования. NVIDIA запустила DeepSeek-R1 на четырёх стойках GB300 NVL72, всего 288 видеокарт, и получила 99% эффективности. Это значит, что четыре стойки выдали почти вчетверо больше, чем одна. Без этого покупка лишнего оборудования окупается плохо: видеокарт больше, а ответов почти столько же. В тесте видеомодели WAN 2.2 стойка сгенерировала 0,65 ролика в 720p в секунду, на один ролик уходило 5,7 секунды.

Программная оптимизация тоже дала прирост. На том же оборудовании GB300 NVL72 выдаёт на Qwen3-VL до 1,6 раза больше, чем в прошлом раунде v6.0. NVIDIA хвалится и результатами, полученными после окончания приёма заявок, на GPT-OSS-120B и DLRMv3. Но организаторы теста из MLCommons их ещё не проверили.

В раунде участвовали 19 партнёров NVIDIA, среди них Azure, CoreWeave, Dell, HPE, Oracle Cloud Infrastructure и Supermicro. Цифру «в 30 раз лучше GB300» из теста для ИИ-агентов SemiAnalysis AgentX компания повторила, но она получена не в MLPerf. Стандартный тест MLPerf для агентных задач ещё только готовят.

← Все новости