8 (800) 302-34-73

InfiniBand: сетевая фабрика для GPU-кластера

InfiniBand — специализированная сетевая фабрика для GPU-кластеров под обучение LLM, fine-tuning foundation-моделей и HPC-нагрузки.
Мы проектируем и поставляем всю фабрику под задачу. Пришлите число GPU-узлов и модель GPU — вернёмся с топологией и спецификацией.

{ сценарии }

Когда GPU-кластеру нужна фабрика InfiniBand

Обучение LLM

Обучение LLM

обучение LLM на 8+ узлах с 8×H100 или H200 — распределённое обучение с частым обменом градиентами через NCCL all-reduce

Fine-tuning

Fine-tuning

Fine-tuning крупных foundation-моделей на 4–16 узлах: LoRA, RLHF, доменная адаптация

HPC-задачи

HPC-задачи

молекулярная динамика, CFD, климатическое моделирование, где узлы обмениваются данными на каждом шаге симуляции

Инференс с шардированием

Инференс с шардированием

инференс крупных моделей с шардированием весов между узлами, когда модель не влезает в один узел

Параллельные ML-нагрузки

Параллельные ML-нагрузки

Мультитенантный ML-кластер: несколько ML-команд запускают распределённые задания параллельно, фабрика делится между ними без взаимной деградации

Оставьте заявку и получите бесплатную консультацию

{ отличия }

Как мы считаем топологию под число GPU

Параметр подбораНа что влияетЧто уточняем у клиента
Число GPU-узлов и GPU на узелЧисло HCA, число коммутаторов, тип топологии (Fat-Tree, Spine-Leaf)Сколько узлов, сколько GPU в каждом (обычно 8)
Поколение GPUH100/H200 → NDR 400G, A100 → HDR 200G часто достаточноМодель GPU в узле
Тип задачТребуемая латентность и bisection bandwidth, тип NCCL-коллективовLLM training, fine-tuning, inference или mixed
Топология: non-blocking 1:1 vs oversubscription 2:1Пропускная bisection, число коммутаторов, стоимостьТребования к non-blocking и планируемый рост
Число хопов в худшем случаеЛатентность в NCCL при рассинхроне узловДопустимая деградация для распределённого обучения
Расстояния между стойкамиDAC (до 3 м), AOC (до 100 м), оптика на длинных линияхКомпоновка стоек в ЦОД, длины трасс
Управление фабрикойOpenSM (open-source) или NVIDIA UFM (коммерческий, с телеметрией)Наличие штатной команды сетевых инженеров, размер кластера
Планы масштабирования на 3–5 летЗапас портов, число leaf-коммутаторов, миграция HDR→NDRКак быстро планируется рост кластера
{ критерии }

InfiniBand vs 400 GbE + RoCEv2 — как выбирает архитектор

КритерийInfiniBand HDR/NDR400 GbE + RoCEv2
Порт-порт латентность~90–130 нс~600–800 нс
Пропускная на порт200 Гбит/с (HDR), 400 Гбит/с (NDR)400 Гбит/с
RDMA нативныйДа, встроенныйДа, но через настройку PFC + ECN + DCQCN
Управление потокомCredit-based, lossless по определениюТребует PFC на всём пути, риск pause-frame шторма
GPUDirect RDMAОтработано, эталонная реализацияРаботает, требует аккуратной настройки
Экосистема NCCLПервоклассная поддержка, эталонПоддерживается, latency выше
Сложность настройкиSubnet Manager (OpenSM или UFM) из коробкиPFC/ECN-тюнинг по всей сети
Совмещение с общим трафиком ЦОДСпециализированная фабрика, отдельно от EthernetМожет нести общий трафик ЦОД
КабелиOSFP DAC/AOC, специфичные для IBQSFP-DD/OSFP, общие с Ethernet
Стоимость на портВыше (специализация)Ниже при массовой закупке
Когда выбираютКрупный тесно-связанный ML/HPC, где важна каждая наносекундаГибридные кластеры + общий трафик ЦОД, когда бюджет критичен
{ конфигурации }

Готовые сценарии фабрики

Фабрика под fine-tuning: 4–8 узлов A100/H100

На что рассчитано: fine-tuning LLM 7B–70B на командной ML-платформе, часть проекта, где вычислительные узлы — GPU-серверы NVIDIA H100 или H200, собранные в связку из 4–8 машин

HCA
ConnectX-7 в каждом узле (2 порта NDR 400G, либо 1 NDR + 1 Ethernet для управления)
Коммутаторы
1–2 Quantum-2 QM9700 (64 порта NDR 400G)
Управление
OpenSM как Subnet Manager
Кабели
DAC OSFP внутри стойки, AOC для соединений до 30 м

Фабрика под pre-training LLM: 16–64 узла H100/H200

На что рассчитано: pre-training крупных LLM (70B+), где NCCL all-reduce определяет 30–50% времени обучения

HCA
ConnectX-7 с 2×NDR 400G на узел (rail-optimized: одна карта на 4 GPU)
Коммутаторы
Двухуровневая Fat-Tree на Quantum-2 QM9700 (leaf + spine)
Управление
NVIDIA UFM с телеметрией и обнаружением congestion
Кабели
OSFP AOC для межстоечных соединений до 100 м

HPC-фабрика на HDR: 8–32 узла с GPU для симуляций

На что рассчитано: HPC-центры вузов, НИИ, суперкомпьютерные симуляции — молекулярная динамика, CFD, климат

HCA
ConnectX-6 VPI (HDR 200 Гбит/с)
Коммутаторы
Quantum QM8700 (40 портов HDR)
Управление
OpenSM (open-source)
Интеграция
Slurm или Kubernetes
{ адаптеры }

Сетевые адаптеры ConnectX-6 и ConnectX-7

МодельПоколениеПортовая скоростьРазъёмОриентация
ConnectX-6 VPIHDR 200 Гбит/с1 или 2 порта 200GQSFP56A100 и HPC-кластеры, экономически оправдан для не-флагмана
ConnectX-6 DxHDR 200 Гбит/с + Ethernet1–2 порта 200GQSFP56Смешанные фабрики IB + Ethernet
ConnectX-7NDR 400 Гбит/с1 или 2 порта 400GOSFPH100/H200, флагманские кластеры под pre-training LLM
ConnectX-7 Socket DirectNDR 400 Гбит/с2 порта 400G, разнесённые по CPU-socketOSFPДвухсокетные узлы с 8 GPU и rail-optimized
{ коммутаторы }

Коммутаторы NVIDIA mellanox Quantum и Quantum-2

МодельПоколениеПортыФорм-факторРоль в кластере
Quantum QM8700HDR 200 Гбит/с (managed)40 портов HDR1UАвтономная фабрика без внешнего SM, x86 CPU, HPC-кластеры на A100
Quantum QM8790HDR 200 Гбит/с (unmanaged / externally managed)40 портов HDR1UТолько через внешний OpenSM или NVIDIA UFM, крупные фабрики
Quantum-2 QM9700NDR 400 Гбит/с (managed)64 порта NDR1UАвтономная фабрика, встроенный SM, Intel Core i3, Fat-Tree под 8–64 узла H100/H200
Quantum-2 QM9790NDR 400 Гбит/с (unmanaged / externally managed)64 порта NDR1UТолько через внешний OpenSM/UFM, развёртывания свыше 2000 узлов
{ сетевые подключения }

Кабели и трансиверы DAC, AOC, OSFP

ТипДлинаКуда применяемКомментарий
Passive DAC OSFP0,5–3 мВнутри стойки, GPU-узел ↔ leaf-коммутатор той же стойкиДешевле, без питания, минимальная латентность
AOC OSFP3–100 мМежду соседними стойками, leaf ↔ spine в разных рядахАктивная оптика встроенная, готовое решение
Трансиверы OSFP 200G/400G + MPO-оптика50–300 м и болееКрупные соединения между рядами, отдельные ЦОД-модулиМаксимальная длина, требует расчёта световой линии
{ комплектация }

Что входит в поставку?

HCA под каждый узел
Коммутаторы Quantum QM8700 или Quantum-2 QM9700
Кабели OSFP DAC/AOC и трансиверы
Лицензия и настройка Subnet Manager
Проектирование топологии Fat-Tree
Кабельный журнал и схема rail-optimized routing
Монтаж в стойки, коммутация, настройка
Мониторинг фабрики, разбор congestion-инцидентов, тюнинг
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Заявка и обследование: 3–5 дней

    число узлов, модель GPU, задачи, планы роста

  2. 2 этап

    Расчёт топологии, спецификация: 7–10 дней

    Fat-Tree на N узлов, число leaf/spine, число портов, длины кабелей

  3. 3 этап

    Согласование, договор

    по графику клиента

  4. 4 этап

    Поставка оборудования: 40–70 дней

    HCA, коммутаторы, OSFP-кабели, лицензии UFM при необходимости

  5. 5 этап

    Монтаж, настройка: 5–10 дней

    монтаж в стойки, кабельные работы, коммутация

  6. 6 этап

    Сдача, гарантия и постпродажное сопровождение

    2–3 рабочих дня

{ под ключ }

Почему выбирают нас?

Фабрика целиком

проектируем и поставляем фабрику целиком, а не собираем связку поштучно

Опыт

опыт Fat-Tree топологий на 4–128 GPU-узлов, экспертиза rail-optimized routing и тюнинга NCCL под конкретный workload

IB или RoCEv2

даём и IB-сценарий, и альтернативу 400 GbE + RoCEv2 — сравнение по TCO и производительности

Вендоры и поставщики

полностью замещённой альтернативы InfiniBand-компонентам в реестре Минпромторга нет, для чувствительных заказчиков раскладываем два сценария. Работа по 44-ФЗ и 223-ФЗ, пакет документов для закупки

Постпродажное сопровождение

мониторинг фабрики, разбор congestion-инцидентов, тюнинг NCCL под новые workloads

{ свяжитесь с нами }

Пришлите ТЗ — вернёмся с топологией и спецификацией

Пришлите число GPU-узлов, модель GPU, тип задач (pre-training, fine-tuning, HPC) и планы роста на 3–5 лет — по итогам заявки и расчёта (10–15 рабочих дней) вернёмся с топологией Fat-Tree, спецификацией HCA, коммутаторов и кабелей, лицензией UFM при необходимости и сроком поставки

{ FAQ }

Часто задаваемые вопросы

Тремя вещами. Порт-порт латентность на порядок ниже (~100 нс против 600–800 нс на 400 GbE). RDMA нативный, без танцев с PFC и ECN. GPUDirect RDMA — эталонная реализация, NCCL коллективы работают из коробки. За это платят более высокой ценой на порт и специализированной инфраструктурой отдельно от Ethernet.

32 узла × 8 GPU × 400 Гбит/с = около 102 Тбит/с теоретически. Практический минимум для non-blocking Fat-Tree — около 50 Тбит/с bisection: хватает, чтобы NCCL all-reduce не стал узким местом при типовых batch size.

64 узла × 2 порта = 128 downlink + 128 uplink к spine. Ёмкость QM9700 — 64 порта. Итого 4 leaf + 4 spine, 8 коммутаторов для non-blocking Fat-Tree. Плюс дублированный Subnet Manager на managed-моделях или отдельным сервером с UFM.

Данные из VRAM одного GPU попадают в VRAM другого напрямую по фабрике, минуя CPU и системную оперативную память. По измерениям на NCCL all-reduce — снижение latency на 30–40% против классической схемы через TCP и CPU. Для моделей с частыми синхронизациями разница на wall-clock времени обучения ощутимая.

OpenSM — open-source, бесплатный, работает под HPC-нагрузки до 32 узлов без нареканий. UFM — коммерческий продукт NVIDIA с телеметрией, обнаружением congestion, GUI и API. Начиная с 32–48 узлов UFM окупается за счёт видимости состояния фабрики и раннего обнаружения деградаций.

Смысл есть, если задачи не флагманский pre-training LLM. HDR на A100 и HPC-симуляциях экономически оправдан ещё несколько лет: производительность сохраняется, стоимость на порт ниже. Для новых кластеров под H100/H200 берём сразу NDR, XDR закладываем как перспективу апгрейда через 3–5 лет.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.