Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

Сетевая обвязка GPU-кластера на 16 GPU

Шестнадцать ускорителей дают 4,8–11,2 кВт на одних только GPU, а вместе с обвязкой нагрузка выходит на 16–20 кВт — выше типового лимита на одну стойку в машинном зале. Отсюда две развилки: раскладывать узлы на две стойки или брать одну высокой плотности, а воздушное охлаждение менять на жидкостный контур. Мы проектируем фабрику fat-tree под мощность вашего зала, собираем комплект и прогоняем полосу между всеми узлами еще до отгрузки
Главная
/
/
/
Обвязка GPU-кластера на 16 GPU
Назад
Обучение крупных моделей
Нужна равная полоса между всеми узлами, иначе синхронизация весов растягивает итерацию
Проект с ограничением по залу
Нужно уложиться в доступную мощность и место — отсюда выбор между плотной стойкой и раскладкой на две
Госпроект или ОПК
Закупка на реестровых платформах с полным пакетом документов
Расширение работающего кластера
Компания переросла 8 GPU и наращивает вычислительную мощность
Оставьте заявку и получите бесплатную консультацию

Что меняется на 16 GPU

{ критерии }

Что определяет обвязку

{ характеристики }
Параметр На что влияет Что уточняем
Число GPU Уровни фабрики и число линков 16 ускорителей, число узлов
Модель ускорителя Плотность стойки и тепло Класс карты по потреблению
Тип нагрузки Требования к неблокирующей полосе Обучение больших моделей или инференс
Мощность на стойку Раскладку на одну или две стойки Доступная мощность и место

Расчет под 16 GPU

{ критерии }
Раздел Что рассчитываем Решение для 16 GPU Что учитываем
Сеть Топологию фабрики, число линков и пропускную способность между узлами Двухуровневая топология fat-tree с коммутаторами доступа и верхнего уровня Полосу uplink подбираем без переподписки, чтобы фабрика оставалась неблокирующей; кабельную схему проектируем заранее
Питание Суммарное энергопотребление GPU, процессоров и серверной обвязки Шестнадцать GPU потребляют 4,8–11,2 кВт, общая нагрузка — около 16–20 кВт Используем две стойки или стойку высокой плотности с усиленным вводом питания; выбор зависит от модели GPU и доступной мощности зала
Охлаждение Отвод тепла при нагрузке 15+ кВт Жидкостное охлаждение или задняя дверь-теплообменник Систему охлаждения проектируем вместе с инженерной инфраструктурой зала и требованиями к размещению оборудования

Три конфигурации

{ конфигурации }
GPU
16 в одной стойке высокой плотности
Сеть
fat-tree, коммутаторы доступа и уровень агрегации
Питание
16–20 кВт, усиленный ввод
Охлаждение
задняя дверь-теплообменник
Плотная стойка
Подходит залу со стойкой высокой плотности и мощным вводом: решение компактное, но требует подготовленной инженерии
GPU
16 в двух стойках по 8
Сеть
fat-tree между стойками
Питание
по 8–10 кВт на стойку
Охлаждение
воздух с горячим коридором или жидкость
Раскладка на две стойки
Закрывает случай со стандартным лимитом мощности на стойку: нагрузка делится, и требования к каждой стойке становятся мягче
GPU
16 сейчас, фабрика под расширение
Сеть
fat-tree с запасом на верхнем уровне
Питание
запас мощности под рост
Охлаждение
жидкостный контур с резервом
С резервом фабрики
Берут, когда кластер будут наращивать дальше: верхний уровень фабрики и охлаждение закладываем с запасом, чтобы расширение не потребовало пересборки

Что входит в поставку?

{ комплектация }
GPU-узлы под расчетную конфигурацию
Сетевые адаптеры и коммутаторы двух уровней fat-tree
Кабельная фабрика — DAC и AOC под длины линий
Стойки с раскладкой питания
Решение по охлаждению: теплообменник или контур
Монтаж, пусконаладка, тест фабрики под нагрузкой
Гарантия и техническая поддержка
Пакет документов под 44-ФЗ или 223-ФЗ
Заказать консультацию
модель ускорителя, тип нагрузки, мощность и место в зале
Разбор задачи: 1–2 дней
топология fat-tree, схема питания, контур охлаждения
Проектирование фабрики: 4–5 дней

Как мы работаем

{ этапы и сроки }
1 этап
монтаж узлов, кабельная фабрика, прогон полосы между всеми узлами
Сборка и тест фабрики: 7–10 дней
запуск фабрики, проверка неблокирующей полосы и задержки
Пусконаладка: 3–4 дня
3 этап
5 этап
2 этап
установка стоек и охлаждения на площадке
Поставка и монтаж: 6–10 недель
4 этап

На что опираемся при проектировании

{ преимущества }
от класса карты зависят плотность стойки и тепловой уровень, а значит и выбор охлаждения
Модель ускорителя и потребление
Горизонт роста
если кластер планируют расширять, верхний уровень фабрики и охлаждение берем с резервом
Импортозамещение и реестр
Кластеры на десятки ускорителей часто идут под госпроекты и ОПК с проверкой происхождения на тендере. Серверные платформы берем из реестра Минпромторга с подтверждением по ПП №719, документы готовим под 44-ФЗ и 223-ФЗ
определяют, идем ли в плотную стойку с усиленным вводом или раскладываем на две
Мощность и место в зале
Требуемая полоса между узлами
под обучение верхний уровень fat-tree считаем так, чтобы полоса вверх не пережимала трафик
Пришлите число GPU, модель ускорителя, тип нагрузки, доступную мощность и место в зале. Спроектируем фабрику, питание и охлаждение, вернемся со спецификацией и КП

Опишите задачу

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Строго говоря, на 2–4 узла одноуровневая схема тоже рабочая. Fat-tree берут, когда узлы разнесены по стойкам или когда кластер планируют растить: простое каскадирование коммутаторов пережимает полосу, а второй уровень сохраняет ее равной между всеми узлами.