Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

InfiniBand: сетевая фабрика для GPU-кластера

InfiniBand — специализированная сетевая фабрика для GPU-кластеров под обучение LLM, fine-tuning foundation-моделей и HPC-нагрузки.
Мы проектируем и поставляем всю фабрику под задачу. Пришлите число GPU-узлов и модель GPU — вернёмся с топологией и спецификацией.
Главная
/
/
InfiniBand
Назад
Обучение LLM
обучение LLM на 8+ узлах с 8×H100 или H200 — распределённое обучение с частым обменом градиентами через NCCL all-reduce
HPC-задачи
молекулярная динамика, CFD, климатическое моделирование, где узлы обмениваются данными на каждом шаге симуляции
Инференс с шардированием
инференс крупных моделей с шардированием весов между узлами, когда модель не влезает в один узел
Параллельные ML-нагрузки
Мультитенантный ML-кластер: несколько ML-команд запускают распределённые задания параллельно, фабрика делится между ними без взаимной деградации
Fine-tuning
Fine-tuning крупных foundation-моделей на 4–16 узлах: LoRA, RLHF, доменная адаптация
Оставьте заявку и получите бесплатную консультацию

Когда GPU-кластеру нужна фабрика InfiniBand

{ сценарии }

Как мы считаем топологию под число GPU

{ отличия }
Параметр подбора На что влияет Что уточняем у клиента
Число GPU-узлов и GPU на узел Число HCA, число коммутаторов, тип топологии (Fat-Tree, Spine-Leaf) Сколько узлов, сколько GPU в каждом (обычно 8)
Поколение GPU H100/H200 → NDR 400G, A100 → HDR 200G часто достаточно Модель GPU в узле
Тип задач Требуемая латентность и bisection bandwidth, тип NCCL-коллективов LLM training, fine-tuning, inference или mixed
Топология: non-blocking 1:1 vs oversubscription 2:1 Пропускная bisection, число коммутаторов, стоимость Требования к non-blocking и планируемый рост
Число хопов в худшем случае Латентность в NCCL при рассинхроне узлов Допустимая деградация для распределённого обучения
Расстояния между стойками DAC (до 3 м), AOC (до 100 м), оптика на длинных линиях Компоновка стоек в ЦОД, длины трасс
Управление фабрикой OpenSM (open-source) или NVIDIA UFM (коммерческий, с телеметрией) Наличие штатной команды сетевых инженеров, размер кластера
Планы масштабирования на 3–5 лет Запас портов, число leaf-коммутаторов, миграция HDR→NDR Как быстро планируется рост кластера

InfiniBand vs 400 GbE + RoCEv2 — как выбирает архитектор

{ критерии }
Критерий InfiniBand HDR/NDR 400 GbE + RoCEv2
Порт-порт латентность ~90–130 нс ~600–800 нс
Пропускная на порт 200 Гбит/с (HDR), 400 Гбит/с (NDR) 400 Гбит/с
RDMA нативный Да, встроенный Да, но через настройку PFC + ECN + DCQCN
Управление потоком Credit-based, lossless по определению Требует PFC на всём пути, риск pause-frame шторма
GPUDirect RDMA Отработано, эталонная реализация Работает, требует аккуратной настройки
Экосистема NCCL Первоклассная поддержка, эталон Поддерживается, latency выше
Сложность настройки Subnet Manager (OpenSM или UFM) из коробки PFC/ECN-тюнинг по всей сети
Совмещение с общим трафиком ЦОД Специализированная фабрика, отдельно от Ethernet Может нести общий трафик ЦОД
Кабели OSFP DAC/AOC, специфичные для IB QSFP-DD/OSFP, общие с Ethernet
Стоимость на порт Выше (специализация) Ниже при массовой закупке
Когда выбирают Крупный тесно-связанный ML/HPC, где важна каждая наносекунда Гибридные кластеры + общий трафик ЦОД, когда бюджет критичен

Готовые сценарии фабрики

{ конфигурации }
HCA
ConnectX-7 в каждом узле (2 порта NDR 400G, либо 1 NDR + 1 Ethernet для управления)
Коммутаторы
1–2 Quantum-2 QM9700 (64 порта NDR 400G)
Управление
OpenSM как Subnet Manager
Кабели
DAC OSFP внутри стойки, AOC для соединений до 30 м
Фабрика под fine-tuning: 4–8 узлов A100/H100
На что рассчитано: fine-tuning LLM 7B–70B на командной ML-платформе, часть проекта, где вычислительные узлы — GPU-серверы NVIDIA H100 или H200, собранные в связку из 4–8 машин
HCA
ConnectX-7 с 2×NDR 400G на узел (rail-optimized: одна карта на 4 GPU)
Коммутаторы
Двухуровневая Fat-Tree на Quantum-2 QM9700 (leaf + spine)
Управление
NVIDIA UFM с телеметрией и обнаружением congestion
Кабели
OSFP AOC для межстоечных соединений до 100 м
Фабрика под pre-training LLM: 16–64 узла H100/H200
На что рассчитано: pre-training крупных LLM (70B+), где NCCL all-reduce определяет 30–50% времени обучения
HCA
ConnectX-6 VPI (HDR 200 Гбит/с)
Коммутаторы
Quantum QM8700 (40 портов HDR)
Управление
OpenSM (open-source)
Интеграция
Slurm или Kubernetes
HPC-фабрика на HDR: 8–32 узла с GPU для симуляций
На что рассчитано: HPC-центры вузов, НИИ, суперкомпьютерные симуляции — молекулярная динамика, CFD, климат

Сетевые адаптеры ConnectX-6 и ConnectX-7

{ адаптеры }
Модель Поколение Портовая скорость Разъём Ориентация
ConnectX-6 VPI HDR 200 Гбит/с 1 или 2 порта 200G QSFP56 A100 и HPC-кластеры, экономически оправдан для не-флагмана
ConnectX-6 Dx HDR 200 Гбит/с + Ethernet 1–2 порта 200G QSFP56 Смешанные фабрики IB + Ethernet
ConnectX-7 NDR 400 Гбит/с 1 или 2 порта 400G OSFP H100/H200, флагманские кластеры под pre-training LLM
ConnectX-7 Socket Direct NDR 400 Гбит/с 2 порта 400G, разнесённые по CPU-socket OSFP Двухсокетные узлы с 8 GPU и rail-optimized

Коммутаторы NVIDIA mellanox Quantum и Quantum-2

{ коммутаторы }
Модель Поколение Порты Форм-фактор Роль в кластере
Quantum QM8700 HDR 200 Гбит/с (managed) 40 портов HDR 1U Автономная фабрика без внешнего SM, x86 CPU, HPC-кластеры на A100
Quantum QM8790 HDR 200 Гбит/с (unmanaged / externally managed) 40 портов HDR 1U Только через внешний OpenSM или NVIDIA UFM, крупные фабрики
Quantum-2 QM9700 NDR 400 Гбит/с (managed) 64 порта NDR 1U Автономная фабрика, встроенный SM, Intel Core i3, Fat-Tree под 8–64 узла H100/H200
Quantum-2 QM9790 NDR 400 Гбит/с (unmanaged / externally managed) 64 порта NDR 1U Только через внешний OpenSM/UFM, развёртывания свыше 2000 узлов

Кабели и трансиверы DAC, AOC, OSFP

{ сетевые подключения }
Тип Длина Куда применяем Комментарий
Passive DAC OSFP 0,5–3 м Внутри стойки, GPU-узел ↔ leaf-коммутатор той же стойки Дешевле, без питания, минимальная латентность
AOC OSFP 3–100 м Между соседними стойками, leaf ↔ spine в разных рядах Активная оптика встроенная, готовое решение
Трансиверы OSFP 200G/400G + MPO-оптика 50–300 м и более Крупные соединения между рядами, отдельные ЦОД-модули Максимальная длина, требует расчёта световой линии

Что входит в поставку?

{ комплектация }
HCA под каждый узел
Коммутаторы Quantum QM8700 или Quantum-2 QM9700
Кабели OSFP DAC/AOC и трансиверы
Лицензия и настройка Subnet Manager
Проектирование топологии Fat-Tree
Кабельный журнал и схема rail-optimized routing
Монтаж в стойки, коммутация, настройка
Мониторинг фабрики, разбор congestion-инцидентов, тюнинг
Заказать консультацию
число узлов, модель GPU, задачи, планы роста
Заявка и обследование: 3–5 дней
Fat-Tree на N узлов, число leaf/spine, число портов, длины кабелей
Расчёт топологии, спецификация: 7–10 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
монтаж в стойки, кабельные работы, коммутация
Монтаж, настройка: 5–10 дней
3 этап
5 этап
2 этап
HCA, коммутаторы, OSFP-кабели, лицензии UFM при необходимости
Поставка оборудования: 40–70 дней
2–3 рабочих дня
Сдача, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас?

{ под ключ }
проектируем и поставляем фабрику целиком, а не собираем связку поштучно
Фабрика целиком
Постпродажное сопровождение
мониторинг фабрики, разбор congestion-инцидентов, тюнинг NCCL под новые workloads
Вендоры и поставщики
полностью замещённой альтернативы InfiniBand-компонентам в реестре Минпромторга нет, для чувствительных заказчиков раскладываем два сценария. Работа по 44-ФЗ и 223-ФЗ, пакет документов для закупки
даём и IB-сценарий, и альтернативу 400 GbE + RoCEv2 — сравнение по TCO и производительности
ШИ bkb КщСУм2
Опыт
опыт Fat-Tree топологий на 4–128 GPU-узлов, экспертиза rail-optimized routing и тюнинга NCCL под конкретный workload
Пришлите число GPU-узлов, модель GPU, тип задач (pre-training, fine-tuning, HPC) и планы роста на 3–5 лет — по итогам заявки и расчёта (10–15 рабочих дней) вернёмся с топологией Fat-Tree, спецификацией HCA, коммутаторов и кабелей, лицензией UFM при необходимости и сроком поставки

Пришлите ТЗ — вернёмся с топологией и спецификацией

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Тремя вещами. Порт-порт латентность на порядок ниже (~100 нс против 600–800 нс на 400 GbE). RDMA нативный, без танцев с PFC и ECN. GPUDirect RDMA — эталонная реализация, NCCL коллективы работают из коробки. За это платят более высокой ценой на порт и специализированной инфраструктурой отдельно от Ethernet.