NVIDIA рассказала об охлаждении стойки Vera Rubin NVL72: вода 45 °C без чиллеров

Стойка ИИ-класса с прямым жидкостным охлаждением в дата-центре

На конференции Hot Chips 2026 компания NVIDIA раскрыла инженерные подробности стоечной платформы Vera Rubin NVL72. Ключевым элементом конструкции названо прямое жидкостное охлаждение с температурой подачи теплоносителя 45 °C: при таком контуре площадке, по утверждению NVIDIA, не нужны чиллеры, а вода не расходуется на испарение.

Тёплая вода 45 °C вместо чиллеров

Стойка Vera Rubin NVL72 построена на открытой платформе MGX третьего поколения. В перечень её базовых свойств NVIDIA включила жидкостное охлаждение на 45 °C, питание 800 В постоянного тока, отказ от ретаймеров, горячую замену компонентов, лотки без кабелей и медную фабрику межсоединений scale-up.

Логика тёплого контура проста: чем выше температура подаваемой жидкости, тем больше разница между контуром и наружным воздухом и тем чаще тепло удаётся сбрасывать без машинного холода. На схеме NVIDIA чиллер и безвозвратные потери воды из тракта исключены, а высвобожденная мощность перераспределяется с отвода тепла на вычисления. Со сцены докладчики отдельно отметили, что вода в контуре горячее, чем в типичном джакузи (около 39 °C).

Вычислительный лоток без кабелей и вентиляторов

Вычислительный лоток Vera Rubin выполнен полностью без кабелей и без вентиляторов — весь теплосъём переведён на жидкость. NVIDIA сравнивает его с лотком предыдущего поколения GB200 NVL72 и утверждает, что отказ от кабельных сборок и вентиляторов сокращает время до первого токена (TTFT) и увеличивает среднюю наработку между прерываниями (MTBI), одновременно упрощая сборку и обслуживание на масштабе стойки.

Платформу MGX третьего поколения, по данным NVIDIA, поддерживают более 80 партнёров: производственные площадки охватывают свыше 350 объектов в 30 странах.

Сглаживание пиков питания

Вторым способом высвободить мощность в стойке NVIDIA называет интеллектуальное сглаживание пиков энергопотребления. Компания показала профили мощности стойки с включённой и выключенной функцией: сглаживание убирает выбросы на разгоне и в холостых интервалах, поэтому под тем же выделенным лимитом питания помещается больше ускорителей.

Для обучения больших языковых моделей на одной стойке Vera Rubin NVL72 заявлено снижение пикового энергопотребления на 13 % и улучшение совместимости с требованиями энергосети. В сумме с прочими системными доработками NVIDIA рассчитывает разместить до 40 % больше ускорителей на каждый выделенный ватт.

Обслуживание без остановки нагрузки

Стойка получила систему RAS второго поколения (RIST). Она выполняет проверки состояния ускорителей без простоя — прямо во время работы нагрузки, — а также включает расширенную коррекцию ошибок SRAM ECC и доработанный сервис горячей замены NVLink. В первом поколении подобная диагностика требовала вывода узла из эксплуатации на несколько часов.

Заявленные характеристики

Показатели производительности NVIDIA приводит не для отдельного ускорителя, а для «ИИ-фабрики» мощностью 100 МВт:

  • 2 Зфлопс в режиме инференса NVFP4 и 1,4 Зфлопс при обучении;
  • 11 Пбайт памяти HBM4 и 800 Пбайт/с суммарной пропускной способности;
  • домен scale-up на 72 ускорителя, объединённых NVLink шестого поколения;
  • 3,6 Тбайт/с полносвязной пропускной способности на каждый ускоритель;
  • жидкостный контур 45 °C и шина питания 800 В постоянного тока.

Сдвиг единицы измерения со стойки на 100-мегаваттную площадку показателен сам по себе: тепловой режим и схема электропитания в такой оптике перестают быть вспомогательной инженерией и становятся частью архитектуры ускорителя.

Источник: ServeTheHome.com

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *