8 (800) 302-34-73

RDMA-сеть для AI: обвязка GPU-кластера

RDMA убирает из передачи процессор: адаптер пишет данные прямо в память узла-получателя, и обмен градиентами перестает конкурировать с вычислениями за ядра CPU. Дальше начинается выбор транспорта — InfiniBand дает минимальную задержку и не требует настройки управления потоком на уровне Ethernet, RoCE дешевле в интеграции, но живет поверх Ethernet и без корректных PFC и ECN проседает на пиках. Мы обосновываем транспорт под вашу нагрузку, собираем фабрику и замеряем задержку с потерями до передачи объекта

{ сценарии }

Зачем AI-кластеру RDMA

Строят кластер с нуля

Строят кластер с нуля

Сеть проектируют сразу, и выбор InfiniBand или RoCE определяет всю фабрику

Обучение упирается в сеть

Обучение упирается в сеть

Ускорители простаивают в ожидании обмена, и нужно снять нагрузку с CPU

Перестраивают Ethernet-сеть

Перестраивают Ethernet-сеть

Уже есть Ethernet, и нужно понять, потянет ли RoCE или нужна отдельная фабрика

Госпроект под реестровое железо

Госпроект под реестровое железо

Сеть собирают на реестровых платформах с документами происхождения

Оставьте заявку и получите бесплатную консультацию

{ характеристики }

InfiniBand или RoCE: как выбирают

КритерийInfiniBandRoCE
Транспортотдельная фабрикаповерх Ethernet
Задержкаминимальнаяниже обычного стека, но выше IB
Настройка сетииз коробки, тонкой настройки не требуеттребует PFC и ECN, иначе теряет пакеты
Интеграциясвоя инфраструктураложится на Ethernet-парк
Когда берутмаксимум производительности, большие кластерыбюджет и совместимость с Ethernet важнее пиковой задержки
{ критерии }

Как RDMA снимает нагрузку с CPU

РазделКак работаетНа что влияетЧто учитываем
Прямой доступ к памятиRDMA позволяет сетевому адаптеру записывать данные напрямую в память узла-получателя без прохождения через сетевой стек ОССнижает загрузку CPU и убирает лишние копирования данных между буферамиПроцессор меньше участвует в передаче и не конкурирует с вычислительной нагрузкой за ядра
Полоса под обмен градиентамиТребуемая пропускная способность рассчитывается по объему градиентов и частоте синхронизации между узламиОпределяет, сколько времени обмен занимает внутри одной итерации обученияУчитываем размер модели, частоту шагов и схему параллелизма; полосу подбираем под конкретную нагрузку
Настройка PFC и ECN для RoCEPFC управляет потоком, а ECN сигнализирует о перегрузке до переполнения сетевых буферовСнижает риск потери пакетов и деградации RoCE при пиковом трафикеНастройку PFC и ECN закладываем в проект заранее, особенно для плотного обмена градиентами
{ конфигурации }

Три сценария сети

InfiniBand-фабрика

Подходит проектам, где важна пиковая производительность обучения и есть готовность содержать отдельную фабрику; управления потоком на уровне Ethernet такой транспорт не требует

Транспорт
выделенная InfiniBand-фабрика
Задержка
минимальная
Настройка
из коробки
Когда
крупный кластер, приоритет производительности

RoCE поверх Ethernet

Подходит, когда сеть строят на Ethernet и важна совместимость с остальной инфраструктурой: интеграция обходится дешевле, но управление потоком требует аккуратной настройки

Транспорт
RDMA поверх Ethernet
Задержка
ниже обычного стека
Настройка
PFC и ECN обязательны
Когда
опора на Ethernet-инфраструктуру

Гибридная схема

Берут, когда контур обучения выносят на InfiniBand, а служебный трафик и хранение оставляют на Ethernet; схему разводим под приоритеты проекта

Транспорт
InfiniBand на обучении, Ethernet на остальном
Задержка
минимальная на критичном контуре
Настройка
раздельные контуры
Когда
нужен баланс цены и производительности
{ комплектация }

Что входит в поставку?

GPU-узлы под расчетную конфигурацию
Сетевые адаптеры с поддержкой RDMA
Коммутаторы под выбранный транспорт
Кабельная фабрика: DAC и AOC под длины линий
Настройка транспорта
Монтаж, пусконаладка, тест сети под нагрузкой
Гарантия и техническая поддержка
Пакет документов под 44-ФЗ или 223-ФЗ
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Разбор проекта: 2 дня

    число узлов, тип нагрузки, существующая сеть

  2. 2 этап

    Выбор транспорта: 3–4 дня

    InfiniBand, RoCE или гибрид, расчет полосы

  3. 3 этап

    Сборка и настройка: 5–8 дней

    фабрика, адаптеры, настройка PFC/ECN при RoCE

  4. 4 этап

    Поставка и монтаж: 4–8 недель

    установка на площадке, коммутация

  5. 5 этап

    Пусконаладка: 2–3 дня

    прогон под нагрузкой, замер задержки и потерь пакетов

{ преимущества }

На что опираемся при проектировании

Приоритет по задержке

если критична минимальная задержка на большом кластере — это довод в пользу InfiniBand

Готовность настраивать сеть

RoCE требует корректных PFC и ECN; без этого он теряет пакеты под нагрузкой

Полоса под обмен градиентами

считаем ее от объема градиентов и частоты синхронизации

Импортозамещение и реестр

AI-инфраструктуру часто закупают под госпроекты и ОПК, где происхождение оборудования проверяют на тендере. Серверные платформы берем из реестра Минпромторга с подтверждением по ПП №719, документы готовим под 44-ФЗ и 223-ФЗ. Собираем сеть целиком под проект

Бюджет и горизонт роста

иногда оправдан гибрид: InfiniBand на критичном контуре, Ethernet на остальном

{ свяжитесь с нами }

Опишите задачу

Пришлите число GPU, модель ускорителя, тип нагрузки, доступную мощность и место в зале. Спроектируем фабрику, питание и охлаждение, вернемся со спецификацией и КП

{ FAQ }

Часто задаваемые вопросы

Прямой доступ к памяти узла в обход ядра ОС. Процессор не обрабатывает каждый пакет, поэтому обмен градиентами не конкурирует с вычислениями за ядра CPU, а задержка обмена падает примерно с 20–50 мкс на обычном стеке до 1–2 мкс на InfiniBand и единиц микросекунд на настроенном RoCE.

InfiniBand берут ради минимальной задержки и когда готовы содержать отдельную фабрику. RoCE — когда сеть строят на Ethernet и важна совместимость с инфраструктурой, при готовности настроить PFC и ECN.

RDMA чувствителен к потере пакетов, а Ethernet под нагрузкой их теряет. PFC и ECN тормозят отправителя до переполнения буферов. Без них RoCE деградирует на пиках обмена.

Универсальной цифры нет: полоса выводится из объема градиентов и частоты шагов, а они у каждой модели свои. Практический диапазон на узел — адаптер 100–400 Гбит/с. Ориентир для проверки: обмен не должен занимать больше времени, чем сам шаг обучения, — это снимаем замером на вашей нагрузке.

Да. Критичный контур обучения выносят на InfiniBand, а служебный трафик и хранение оставляют на Ethernet — это гибридная схема под баланс цены и производительности.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.