
AMD на конференции Hot Chips 2026 подробно описала системную архитектуру стойки Helios под ускорители Instinct MI400. Вся стойка построена вокруг жидкостного охлаждения: подключение лотков к контуру выполнено через быстроразъёмные соединения слепого стыка (blind-mate QD), а один только коммутационный лоток отводит жидкостью около 7 кВт.
Шасси 44OU и охлаждение слепым стыком
Физически Helios — это шасси формата 44OU стандарта ORW-HPR (Open Rack Wide, разработка Open Compute Project). В конфигурации на 72 ускорителя в него устанавливаются 18 вычислительных лотков и шесть коммутационных.
Стойка комплектуется жидкостным охлаждением с быстроразъёмами слепого стыка, резервированными источниками питания и шиной постоянного тока на 50 В. Схема со слепым стыком означает, что вычислительный лоток подключается к жидкостному контуру и питанию одним движением при установке в шасси, без ручного соединения шлангов — это ключевое условие для обслуживания стоек такой плотности.
Коммутационный лоток на 7 кВт
Отдельного внимания заслуживает коммутационный лоток фабрики scale-up. В нём размещаются два ASIC UALoE на 512 портов 200G, обеспечивающие 10,8 Тбайт/с в каждом направлении и 72 активных канала на коммутатор, а также управляющий контроллер BMC на базе Ryzen. Тепловыделение такого лотка AMD оценивает примерно в 7 кВт, и он также охлаждается жидкостью.
То, что жидкость подводится не только к вычислительным, но и к коммутационным лоткам, отражает общий сдвиг отрасли: при росте плотности вычислений сетевая часть стойки перестаёт умещаться в воздушный теплосъём.
Состав стойки
Одна стойка Helios в конфигурации на 72 ускорителя, по данным AMD, обеспечивает:
- 72 ускорителя Instinct MI455X и 31 Тбайт памяти HBM4;
- 2,9 Эфлопс заявленной производительности в ИИ-задачах;
- 1,7 Пбайт/с пропускной способности HBM4;
- 260 Тбайт/с пропускной способности фабрики scale-up;
- 43 Тбайт/с пропускной способности scale-out.
В каждом вычислительном лотке размещены четыре модуля Instinct MI455X и один процессор EPYC Venice в исполнении SP7 с 96 ядрами. На ускоритель приходится 1,8 Тбайт/с в каждом направлении по 12 каналам UALoE, когерентная шина Infinity Fabric на 128 Гбайт/с до процессора и до трёх сетевых адаптеров Pensando Vulcano 800.
Отказоустойчивость
AMD показала сценарии отказов фабрики: одиночные ошибки обрабатывает надёжный канальный уровень, а при потере целого коммутационного лотка нагрузка DMA перераспределяется на пять оставшихся из шести. Стойка также поддерживает разделение на виртуальные пулы (VPod), изолированные друг от друга, так что отказ узла остаётся в границах своего пула.
Совокупно конструкция Helios показывает, что рэк-масштабные ИИ-платформы обеих ведущих платформ окончательно перешли на жидкость как на базовый, а не опциональный способ теплосъёма.
Источник: ServeTheHome.com
