8 (800) 302-34-73

Сетевая обвязка GPU-кластера на 8 GPU

Восемь ускорителей — это уже не «поставить карты в сервер»: 2,4–5,6 кВт приходится на одни только GPU, а вместе с процессорами и обвязкой стойка выходит на 8–10 кВт. Воздушное охлаждение на этом уровне еще справляется, но лишь при организованном горячем коридоре, а питание приходится раскладывать на несколько линий. Мы считаем сеть, питание и климат под выбранную модель ускорителя и поставляем комплект целиком, от узлов до кабелей

{ сценарии }

Когда 8 GPU — это уже кластер, а не сервер

Обучение своих моделей

Обучение своих моделей

Дообучение или обучение с нуля на восьми ускорителях, где узлам нужен быстрый обмен градиентами

Инференс под нагрузкой

Инференс под нагрузкой

Запуск больших моделей в продакшене с распределением по картам

Первый кластер после одиночных серверов

Первый кластер после одиночных серверов

Компания упирается в один GPU-сервер и переходит к связке узлов

Госпроект или ОПК

Госпроект или ОПК

Закупка под реестровую платформу с документами происхождения

Оставьте заявку и получите бесплатную консультацию

{ характеристики }

Что определяет обвязку

ПараметрНа что влияетЧто уточняем
Число GPUЧисло узлов и портов сети8 ускорителей в одном узле или в двух
Модель ускорителяПитание и тепловыделениеКласс карты по потреблению
Тип нагрузкиТребования к полосе и задержкеОбучение, инференс, смешанный режим
Бюджет питания стойкиСхему электропитанияДоступная мощность на стойку
{ критерии }

Расчет под 8 GPU

РазделЧто рассчитываемРешение для 8 GPUЧто учитываем
СетьСвязь между узлами, число портов, пропускную способностьОдноуровневая фабрика, неблокирующий коммутатор на 8–16 портов, топология «звезда»По одному адаптеру на узел, отдельные порты под хранилище и управление, запас под рост, DAC-кабели внутри стойки
Питание стойкиСуммарное энергопотребление GPU и серверной обвязкиВосемь GPU класса 300–700 Вт потребляют 2,4–5,6 кВт, вся стойка — около 8–10 кВтПитание распределяем на несколько линий с запасом, точный расчет привязываем к модели ускорителя
ОхлаждениеОтвод тепла от стойки мощностью около 10 кВтВоздушное охлаждение с организованным горячим коридоромХолодный воздух подается спереди, горячий отводится назад без смешивания; учитываем компоновку стойки и климат помещения
{ конфигурации }

Три конфигурации

Компактная — один узел

Подходит, когда все восемь карт живут в одной машине: межузловая фабрика пока не нужна, но адаптер закладываем под будущее расширение

GPU
8 в одном узле
Сеть
внутренняя шина, внешний адаптер под рост
Питание
8–10 кВт на стойку
Охлаждение
воздух, горячий коридор

Стандартная — два узла 4×GPU

Закрывает распределенное обучение на двух узлах: они связаны неблокирующим коммутатором, и задержка между ними остается минимальной

GPU
8 в двух узлах по 4
Сеть
коммутатор 8–16 портов, «звезда»
Питание
8–10 кВт, раскладка по фазам
Охлаждение
воздух, организованный коридор

С запасом под рост

Берут, когда кластер планируют наращивать: коммутатор и стойку закладываем с резервом, чтобы переход на 16 GPU не потребовал переборки фабрики

GPU
8 сейчас, порты под 16
Сеть
коммутатор с резервом портов
Питание
запас мощности на стойку
Охлаждение
коридор с запасом по теплоотводу
{ комплектация }

Что входит в поставку?

GPU-узлы под расчетную конфигурацию
Сетевые адаптеры по числу узлов
Неблокирующий коммутатор фабрики
DAC-кабели и коммутация
Стойка с раскладкой питания
Монтаж, пусконаладка, тест фабрики под нагрузкой
Гарантия и техническая поддержка
Пакет документов под 44-ФЗ или 223-ФЗ
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Разбор задачи: 1–2 дней

    модель ускорителя, тип нагрузки, доступная мощность стойки

  2. 2 этап

    Расчет конфигурации: 3–4 дня

    узлы, сеть, питание, охлаждение

  3. 3 этап

    Сборка и тест фабрики: 5–7 дня

    монтаж узлов, коммутация, прогон под нагрузкой

  4. 4 этап

    Поставка и монтаж: 4–8 недель

    установка стойки на площадке

  5. 5 этап

    Пусконаладка: 2–3 дня

    запуск фабрики, проверка полосы и задержки

{ преимущества }

На что опираемся при расчете

Модель ускорителя и его потребление

от класса карты зависит и питание стойки, и тепловыделение — разброс между картами кратный

Тип нагрузки

обучение требует широкой полосы между узлами, инференс — меньше; под это подбираем коммутатор и число адаптеров

Доступная мощность стойки

считаем, влезает ли 8–10 кВт в один ввод или нужна раскладка по фазам

Импортозамещение и реестр

Инфраструктуру под обучение часто закупают под госпроекты и ОПК. Серверные платформы берем из реестра Минпромторга с подтверждением по ПП №719, документы готовим под 44-ФЗ и 223-ФЗ. Сетевую часть описываем категориями — адаптер, коммутатор, кабели — и собираем фабрику целиком под задачу

Планы по росту

если кластер будут наращивать, коммутатор и стойку берем с запасом портов и мощности

{ свяжитесь с нами }

Опишите задачу

Пришлите число GPU, модель ускорителя, тип нагрузки, доступную мощность и место в зале. Спроектируем фабрику, питание и охлаждение, вернемся со спецификацией и КП

{ FAQ }

Часто задаваемые вопросы

Пока узел один — нет, карты связаны внутренней шиной. Но адаптер стоит заложить сразу, если планируется рост до двух узлов и более.

8–10 кВт. Считайте по верхней границе класса карт: восемь ускорителей по 700 Вт — это 5,6 кВт, и еще 3–4 кВт добавляют процессоры с обвязкой. Одна фаза не тянет, раскладываем на несколько линий.

До 10 кВт на стойку — да, но только с разделением потоков. Практический признак, что коридор организован плохо: карты сбрасывают частоту под длительной нагрузкой, хотя по паспорту запас есть.

Коммутатор, который пропускает трафик всех портов одновременно, не пережимая полосу. При обучении на нескольких узлах от этого напрямую зависит длительность шага.

Можно, если на старте взять коммутатор и стойку с запасом портов и мощности. Иначе переход потребует переборки фабрики.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.