
Строят кластер с нуля
Сеть проектируют сразу, и выбор InfiniBand или RoCE определяет всю фабрику

RDMA убирает из передачи процессор: адаптер пишет данные прямо в память узла-получателя, и обмен градиентами перестает конкурировать с вычислениями за ядра CPU. Дальше начинается выбор транспорта — InfiniBand дает минимальную задержку и не требует настройки управления потоком на уровне Ethernet, RoCE дешевле в интеграции, но живет поверх Ethernet и без корректных PFC и ECN проседает на пиках. Мы обосновываем транспорт под вашу нагрузку, собираем фабрику и замеряем задержку с потерями до передачи объекта

Строят кластер с нуля
Сеть проектируют сразу, и выбор InfiniBand или RoCE определяет всю фабрику

Обучение упирается в сеть
Ускорители простаивают в ожидании обмена, и нужно снять нагрузку с CPU

Перестраивают Ethernet-сеть
Уже есть Ethernet, и нужно понять, потянет ли RoCE или нужна отдельная фабрика

Госпроект под реестровое железо
Сеть собирают на реестровых платформах с документами происхождения

Оставьте заявку и получите бесплатную консультацию
| Критерий | InfiniBand | RoCE |
|---|---|---|
| Транспорт | отдельная фабрика | поверх Ethernet |
| Задержка | минимальная | ниже обычного стека, но выше IB |
| Настройка сети | из коробки, тонкой настройки не требует | требует PFC и ECN, иначе теряет пакеты |
| Интеграция | своя инфраструктура | ложится на Ethernet-парк |
| Когда берут | максимум производительности, большие кластеры | бюджет и совместимость с Ethernet важнее пиковой задержки |
| Раздел | Как работает | На что влияет | Что учитываем |
|---|---|---|---|
| Прямой доступ к памяти | RDMA позволяет сетевому адаптеру записывать данные напрямую в память узла-получателя без прохождения через сетевой стек ОС | Снижает загрузку CPU и убирает лишние копирования данных между буферами | Процессор меньше участвует в передаче и не конкурирует с вычислительной нагрузкой за ядра |
| Полоса под обмен градиентами | Требуемая пропускная способность рассчитывается по объему градиентов и частоте синхронизации между узлами | Определяет, сколько времени обмен занимает внутри одной итерации обучения | Учитываем размер модели, частоту шагов и схему параллелизма; полосу подбираем под конкретную нагрузку |
| Настройка PFC и ECN для RoCE | PFC управляет потоком, а ECN сигнализирует о перегрузке до переполнения сетевых буферов | Снижает риск потери пакетов и деградации RoCE при пиковом трафике | Настройку PFC и ECN закладываем в проект заранее, особенно для плотного обмена градиентами |
InfiniBand-фабрика
Подходит проектам, где важна пиковая производительность обучения и есть готовность содержать отдельную фабрику; управления потоком на уровне Ethernet такой транспорт не требует
RoCE поверх Ethernet
Подходит, когда сеть строят на Ethernet и важна совместимость с остальной инфраструктурой: интеграция обходится дешевле, но управление потоком требует аккуратной настройки
Гибридная схема
Берут, когда контур обучения выносят на InfiniBand, а служебный трафик и хранение оставляют на Ethernet; схему разводим под приоритеты проекта
Разбор проекта: 2 дня
число узлов, тип нагрузки, существующая сеть
Выбор транспорта: 3–4 дня
InfiniBand, RoCE или гибрид, расчет полосы
Сборка и настройка: 5–8 дней
фабрика, адаптеры, настройка PFC/ECN при RoCE
Поставка и монтаж: 4–8 недель
установка на площадке, коммутация
Пусконаладка: 2–3 дня
прогон под нагрузкой, замер задержки и потерь пакетов

Приоритет по задержке
если критична минимальная задержка на большом кластере — это довод в пользу InfiniBand

Готовность настраивать сеть
RoCE требует корректных PFC и ECN; без этого он теряет пакеты под нагрузкой
Полоса под обмен градиентами
считаем ее от объема градиентов и частоты синхронизации

Импортозамещение и реестр
AI-инфраструктуру часто закупают под госпроекты и ОПК, где происхождение оборудования проверяют на тендере. Серверные платформы берем из реестра Минпромторга с подтверждением по ПП №719, документы готовим под 44-ФЗ и 223-ФЗ. Собираем сеть целиком под проект

Бюджет и горизонт роста
иногда оправдан гибрид: InfiniBand на критичном контуре, Ethernet на остальном

Пришлите число GPU, модель ускорителя, тип нагрузки, доступную мощность и место в зале. Спроектируем фабрику, питание и охлаждение, вернемся со спецификацией и КП
Прямой доступ к памяти узла в обход ядра ОС. Процессор не обрабатывает каждый пакет, поэтому обмен градиентами не конкурирует с вычислениями за ядра CPU, а задержка обмена падает примерно с 20–50 мкс на обычном стеке до 1–2 мкс на InfiniBand и единиц микросекунд на настроенном RoCE.
InfiniBand берут ради минимальной задержки и когда готовы содержать отдельную фабрику. RoCE — когда сеть строят на Ethernet и важна совместимость с инфраструктурой, при готовности настроить PFC и ECN.
RDMA чувствителен к потере пакетов, а Ethernet под нагрузкой их теряет. PFC и ECN тормозят отправителя до переполнения буферов. Без них RoCE деградирует на пиках обмена.
Универсальной цифры нет: полоса выводится из объема градиентов и частоты шагов, а они у каждой модели свои. Практический диапазон на узел — адаптер 100–400 Гбит/с. Ориентир для проверки: обмен не должен занимать больше времени, чем сам шаг обучения, — это снимаем замером на вашей нагрузке.
Да. Критичный контур обучения выносят на InfiniBand, а служебный трафик и хранение оставляют на Ethernet — это гибридная схема под баланс цены и производительности.

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.