
Компания Cerebras 19 августа 2026 года представила ИИ-систему CS-4, построенную вокруг трёх ускорителей Wafer Scale Engine 3 Turbo. Тепловой пакет одного кристалла заявлен на уровне 33 кВт, всей стойки — 120–140 кВт, поэтому отвод тепла в новой платформе целиком построен на прямом жидкостном охлаждении.
Три пластины в одной стойке
Каждый ускоритель WSE-3 Turbo представляет собой цельную кремниевую пластину: 4 трлн транзисторов, около 900 тыс. вычислительных ядер и 44 Гбайт памяти SRAM. Пропускная способность памяти одной пластины выросла с 21,6 до 43,2 Пбайт/с, пропускная способность ввода-вывода — до 2,4 Тбит/с. В пересчёте на стойку это даёт 129,6 Пбайт/с и 7,2 Тбит/с соответственно.
Пиковая производительность на разреженных вычислениях FP16 составляет 250 Пфлопс на пластину и 750 Пфлопс на стойку. Задержка передачи данных между соседними пластинами не превышает 2 мкс.
Модуль Wafer-Scale Backpack
Конструктивно CS-4 собрана из трёх одинаковых модулей Wafer-Scale Backpack, объединённых в шасси архитектуры Nexus. Каждый модуль — самостоятельный узел, в котором совмещены ускоритель, подсистема преобразования питания, контур охлаждения и интерфейсы ввода-вывода.
- ускоритель WSE-3 Turbo с тепловым пакетом 33 кВт;
- преобразователи питания, вынесенные на расстояние 0,5 мм от кристалла вместо прежних 50 мм;
- интегрированный контур прямого жидкостного охлаждения;
- интерфейсы ввода-вывода на 2,4 Тбит/с.
Сокращение дистанции подвода питания в сто раз, по данным Cerebras, практически устраняет потери на плате и позволяет поднять рабочие частоты. Одновременно это уплотняет тепловыделение на единицу площади, что делает воздушное охлаждение неприменимым.
Развёртывание и производительность
По сравнению с предыдущим поколением CS-3 разработчик заявляет десятикратный рост пропускной способности на ватт. Число компонентов в системе сокращено примерно вдвое, а срок ввода стойки в эксплуатацию, по утверждению компании, снижается с нескольких дней до нескольких часов.
На модели GPT-OSS-120B система выдаёт свыше 4400 токенов в секунду на одного пользователя против примерно 350 токенов в секунду у распространённых сервисов на графических ускорителях. Первые отгрузки CS-4 запланированы на третий квартал 2026 года.
Источник: ServerNews.ru
