
Обучение крупных моделей
Нужна равная полоса между всеми узлами, иначе синхронизация весов растягивает итерацию

Шестнадцать ускорителей дают 4,8–11,2 кВт на одних только GPU, а вместе с обвязкой нагрузка выходит на 16–20 кВт — выше типового лимита на одну стойку в машинном зале. Отсюда две развилки: раскладывать узлы на две стойки или брать одну высокой плотности, а воздушное охлаждение менять на жидкостный контур. Мы проектируем фабрику fat-tree под мощность вашего зала, собираем комплект и прогоняем полосу между всеми узлами еще до отгрузки

Обучение крупных моделей
Нужна равная полоса между всеми узлами, иначе синхронизация весов растягивает итерацию

Расширение работающего кластера
Компания переросла 8 GPU и наращивает вычислительную мощность

Проект с ограничением по залу
Нужно уложиться в доступную мощность и место — отсюда выбор между плотной стойкой и раскладкой на две

Госпроект или ОПК
Закупка на реестровых платформах с полным пакетом документов

Оставьте заявку и получите бесплатную консультацию
| Параметр | На что влияет | Что уточняем |
|---|---|---|
| Число GPU | Уровни фабрики и число линков | 16 ускорителей, число узлов |
| Модель ускорителя | Плотность стойки и тепло | Класс карты по потреблению |
| Тип нагрузки | Требования к неблокирующей полосе | Обучение больших моделей или инференс |
| Мощность на стойку | Раскладку на одну или две стойки | Доступная мощность и место |
| Раздел | Что рассчитываем | Решение для 16 GPU | Что учитываем |
|---|---|---|---|
| Сеть | Топологию фабрики, число линков и пропускную способность между узлами | Двухуровневая топология fat-tree с коммутаторами доступа и верхнего уровня | Полосу uplink подбираем без переподписки, чтобы фабрика оставалась неблокирующей; кабельную схему проектируем заранее |
| Питание | Суммарное энергопотребление GPU, процессоров и серверной обвязки | Шестнадцать GPU потребляют 4,8–11,2 кВт, общая нагрузка — около 16–20 кВт | Используем две стойки или стойку высокой плотности с усиленным вводом питания; выбор зависит от модели GPU и доступной мощности зала |
| Охлаждение | Отвод тепла при нагрузке 15+ кВт | Жидкостное охлаждение или задняя дверь-теплообменник | Систему охлаждения проектируем вместе с инженерной инфраструктурой зала и требованиями к размещению оборудования |
Плотная стойка
Подходит залу со стойкой высокой плотности и мощным вводом: решение компактное, но требует подготовленной инженерии
Раскладка на две стойки
Закрывает случай со стандартным лимитом мощности на стойку: нагрузка делится, и требования к каждой стойке становятся мягче
С резервом фабрики
Берут, когда кластер будут наращивать дальше: верхний уровень фабрики и охлаждение закладываем с запасом, чтобы расширение не потребовало пересборки
Разбор задачи: 1–2 дней
модель ускорителя, тип нагрузки, мощность и место в зале
Проектирование фабрики: 4–5 дней
топология fat-tree, схема питания, контур охлаждения
Сборка и тест фабрики: 7–10 дней
монтаж узлов, кабельная фабрика, прогон полосы между всеми узлами
Поставка и монтаж: 6–10 недель
установка стоек и охлаждения на площадке
Пусконаладка: 3–4 дня
запуск фабрики, проверка неблокирующей полосы и задержки

Модель ускорителя и потребление
от класса карты зависят плотность стойки и тепловой уровень, а значит и выбор охлаждения

Требуемая полоса между узлами
под обучение верхний уровень fat-tree считаем так, чтобы полоса вверх не пережимала трафик
Мощность и место в зале
определяют, идем ли в плотную стойку с усиленным вводом или раскладываем на две

Импортозамещение и реестр
Кластеры на десятки ускорителей часто идут под госпроекты и ОПК с проверкой происхождения на тендере. Серверные платформы берем из реестра Минпромторга с подтверждением по ПП №719, документы готовим под 44-ФЗ и 223-ФЗ

Горизонт роста
если кластер планируют расширять, верхний уровень фабрики и охлаждение берем с резервом

Пришлите число GPU, модель ускорителя, тип нагрузки, доступную мощность и место в зале. Спроектируем фабрику, питание и охлаждение, вернемся со спецификацией и КП
Строго говоря, на 2–4 узла одноуровневая схема тоже рабочая. Fat-tree берут, когда узлы разнесены по стойкам или когда кластер планируют растить: простое каскадирование коммутаторов пережимает полосу, а второй уровень сохраняет ее равной между всеми узлами.
От 4,8 до 11,2 кВт на самих ускорителях и 16–20 кВт вместе с обвязкой. Порог решения — типовой лимит вашего зала на стойку: если он ниже 16 кВт, нагрузку раскладывают на две стойки.
Порог примерно 15 кВт на стойку: выше него воздуху не хватает объема, чтобы унести тепло. Дальше выбор между жидкостным контуром и задней дверью-теплообменником — второе проще внедрить в существующем зале.
Зависит от мощности и инженерии зала. Плотная компактнее, но требует усиленного ввода и жидкости; раскладка на две мягче по требованиям к каждой стойке.
Да, если верхний уровень fat-tree и охлаждение заложены с запасом. Тогда добавление узлов не потребует пересборки фабрики.

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.