| Параметр подбора | На что влияет | Что уточняем у клиента |
|---|---|---|
| Число GPU-узлов и GPU на узел | Число HCA, число коммутаторов, тип топологии (Fat-Tree, Spine-Leaf) | Сколько узлов, сколько GPU в каждом (обычно 8) |
| Поколение GPU | H100/H200 → NDR 400G, A100 → HDR 200G часто достаточно | Модель GPU в узле |
| Тип задач | Требуемая латентность и bisection bandwidth, тип NCCL-коллективов | LLM training, fine-tuning, inference или mixed |
| Топология: non-blocking 1:1 vs oversubscription 2:1 | Пропускная bisection, число коммутаторов, стоимость | Требования к non-blocking и планируемый рост |
| Число хопов в худшем случае | Латентность в NCCL при рассинхроне узлов | Допустимая деградация для распределённого обучения |
| Расстояния между стойками | DAC (до 3 м), AOC (до 100 м), оптика на длинных линиях | Компоновка стоек в ЦОД, длины трасс |
| Управление фабрикой | OpenSM (open-source) или NVIDIA UFM (коммерческий, с телеметрией) | Наличие штатной команды сетевых инженеров, размер кластера |
| Планы масштабирования на 3–5 лет | Запас портов, число leaf-коммутаторов, миграция HDR→NDR | Как быстро планируется рост кластера |
| Критерий | InfiniBand HDR/NDR | 400 GbE + RoCEv2 |
|---|---|---|
| Порт-порт латентность | ~90–130 нс | ~600–800 нс |
| Пропускная на порт | 200 Гбит/с (HDR), 400 Гбит/с (NDR) | 400 Гбит/с |
| RDMA нативный | Да, встроенный | Да, но через настройку PFC + ECN + DCQCN |
| Управление потоком | Credit-based, lossless по определению | Требует PFC на всём пути, риск pause-frame шторма |
| GPUDirect RDMA | Отработано, эталонная реализация | Работает, требует аккуратной настройки |
| Экосистема NCCL | Первоклассная поддержка, эталон | Поддерживается, latency выше |
| Сложность настройки | Subnet Manager (OpenSM или UFM) из коробки | PFC/ECN-тюнинг по всей сети |
| Совмещение с общим трафиком ЦОД | Специализированная фабрика, отдельно от Ethernet | Может нести общий трафик ЦОД |
| Кабели | OSFP DAC/AOC, специфичные для IB | QSFP-DD/OSFP, общие с Ethernet |
| Стоимость на порт | Выше (специализация) | Ниже при массовой закупке |
| Когда выбирают | Крупный тесно-связанный ML/HPC, где важна каждая наносекунда | Гибридные кластеры + общий трафик ЦОД, когда бюджет критичен |
| Модель | Поколение | Портовая скорость | Разъём | Ориентация |
|---|---|---|---|---|
| ConnectX-6 VPI | HDR 200 Гбит/с | 1 или 2 порта 200G | QSFP56 | A100 и HPC-кластеры, экономически оправдан для не-флагмана |
| ConnectX-6 Dx | HDR 200 Гбит/с + Ethernet | 1–2 порта 200G | QSFP56 | Смешанные фабрики IB + Ethernet |
| ConnectX-7 | NDR 400 Гбит/с | 1 или 2 порта 400G | OSFP | H100/H200, флагманские кластеры под pre-training LLM |
| ConnectX-7 Socket Direct | NDR 400 Гбит/с | 2 порта 400G, разнесённые по CPU-socket | OSFP | Двухсокетные узлы с 8 GPU и rail-optimized |
| Модель | Поколение | Порты | Форм-фактор | Роль в кластере |
|---|---|---|---|---|
| Quantum QM8700 | HDR 200 Гбит/с (managed) | 40 портов HDR | 1U | Автономная фабрика без внешнего SM, x86 CPU, HPC-кластеры на A100 |
| Quantum QM8790 | HDR 200 Гбит/с (unmanaged / externally managed) | 40 портов HDR | 1U | Только через внешний OpenSM или NVIDIA UFM, крупные фабрики |
| Quantum-2 QM9700 | NDR 400 Гбит/с (managed) | 64 порта NDR | 1U | Автономная фабрика, встроенный SM, Intel Core i3, Fat-Tree под 8–64 узла H100/H200 |
| Quantum-2 QM9790 | NDR 400 Гбит/с (unmanaged / externally managed) | 64 порта NDR | 1U | Только через внешний OpenSM/UFM, развёртывания свыше 2000 узлов |
| Тип | Длина | Куда применяем | Комментарий |
|---|---|---|---|
| Passive DAC OSFP | 0,5–3 м | Внутри стойки, GPU-узел ↔ leaf-коммутатор той же стойки | Дешевле, без питания, минимальная латентность |
| AOC OSFP | 3–100 м | Между соседними стойками, leaf ↔ spine в разных рядах | Активная оптика встроенная, готовое решение |
| Трансиверы OSFP 200G/400G + MPO-оптика | 50–300 м и более | Крупные соединения между рядами, отдельные ЦОД-модули | Максимальная длина, требует расчёта световой линии |