
Обучение LLM
обучение LLM на 8+ узлах с 8×H100 или H200 — распределённое обучение с частым обменом градиентами через NCCL all-reduce

InfiniBand — специализированная сетевая фабрика для GPU-кластеров под обучение LLM, fine-tuning foundation-моделей и HPC-нагрузки.
Мы проектируем и поставляем всю фабрику под задачу. Пришлите число GPU-узлов и модель GPU — вернёмся с топологией и спецификацией.

Обучение LLM
обучение LLM на 8+ узлах с 8×H100 или H200 — распределённое обучение с частым обменом градиентами через NCCL all-reduce

Fine-tuning
Fine-tuning крупных foundation-моделей на 4–16 узлах: LoRA, RLHF, доменная адаптация

HPC-задачи
молекулярная динамика, CFD, климатическое моделирование, где узлы обмениваются данными на каждом шаге симуляции

Инференс с шардированием
инференс крупных моделей с шардированием весов между узлами, когда модель не влезает в один узел

Параллельные ML-нагрузки
Мультитенантный ML-кластер: несколько ML-команд запускают распределённые задания параллельно, фабрика делится между ними без взаимной деградации

Оставьте заявку и получите бесплатную консультацию
| Параметр подбора | На что влияет | Что уточняем у клиента |
|---|---|---|
| Число GPU-узлов и GPU на узел | Число HCA, число коммутаторов, тип топологии (Fat-Tree, Spine-Leaf) | Сколько узлов, сколько GPU в каждом (обычно 8) |
| Поколение GPU | H100/H200 → NDR 400G, A100 → HDR 200G часто достаточно | Модель GPU в узле |
| Тип задач | Требуемая латентность и bisection bandwidth, тип NCCL-коллективов | LLM training, fine-tuning, inference или mixed |
| Топология: non-blocking 1:1 vs oversubscription 2:1 | Пропускная bisection, число коммутаторов, стоимость | Требования к non-blocking и планируемый рост |
| Число хопов в худшем случае | Латентность в NCCL при рассинхроне узлов | Допустимая деградация для распределённого обучения |
| Расстояния между стойками | DAC (до 3 м), AOC (до 100 м), оптика на длинных линиях | Компоновка стоек в ЦОД, длины трасс |
| Управление фабрикой | OpenSM (open-source) или NVIDIA UFM (коммерческий, с телеметрией) | Наличие штатной команды сетевых инженеров, размер кластера |
| Планы масштабирования на 3–5 лет | Запас портов, число leaf-коммутаторов, миграция HDR→NDR | Как быстро планируется рост кластера |
| Критерий | InfiniBand HDR/NDR | 400 GbE + RoCEv2 |
|---|---|---|
| Порт-порт латентность | ~90–130 нс | ~600–800 нс |
| Пропускная на порт | 200 Гбит/с (HDR), 400 Гбит/с (NDR) | 400 Гбит/с |
| RDMA нативный | Да, встроенный | Да, но через настройку PFC + ECN + DCQCN |
| Управление потоком | Credit-based, lossless по определению | Требует PFC на всём пути, риск pause-frame шторма |
| GPUDirect RDMA | Отработано, эталонная реализация | Работает, требует аккуратной настройки |
| Экосистема NCCL | Первоклассная поддержка, эталон | Поддерживается, latency выше |
| Сложность настройки | Subnet Manager (OpenSM или UFM) из коробки | PFC/ECN-тюнинг по всей сети |
| Совмещение с общим трафиком ЦОД | Специализированная фабрика, отдельно от Ethernet | Может нести общий трафик ЦОД |
| Кабели | OSFP DAC/AOC, специфичные для IB | QSFP-DD/OSFP, общие с Ethernet |
| Стоимость на порт | Выше (специализация) | Ниже при массовой закупке |
| Когда выбирают | Крупный тесно-связанный ML/HPC, где важна каждая наносекунда | Гибридные кластеры + общий трафик ЦОД, когда бюджет критичен |
Фабрика под fine-tuning: 4–8 узлов A100/H100
На что рассчитано: fine-tuning LLM 7B–70B на командной ML-платформе, часть проекта, где вычислительные узлы — GPU-серверы NVIDIA H100 или H200, собранные в связку из 4–8 машин
Фабрика под pre-training LLM: 16–64 узла H100/H200
На что рассчитано: pre-training крупных LLM (70B+), где NCCL all-reduce определяет 30–50% времени обучения
HPC-фабрика на HDR: 8–32 узла с GPU для симуляций
На что рассчитано: HPC-центры вузов, НИИ, суперкомпьютерные симуляции — молекулярная динамика, CFD, климат
| Модель | Поколение | Портовая скорость | Разъём | Ориентация |
|---|---|---|---|---|
| ConnectX-6 VPI | HDR 200 Гбит/с | 1 или 2 порта 200G | QSFP56 | A100 и HPC-кластеры, экономически оправдан для не-флагмана |
| ConnectX-6 Dx | HDR 200 Гбит/с + Ethernet | 1–2 порта 200G | QSFP56 | Смешанные фабрики IB + Ethernet |
| ConnectX-7 | NDR 400 Гбит/с | 1 или 2 порта 400G | OSFP | H100/H200, флагманские кластеры под pre-training LLM |
| ConnectX-7 Socket Direct | NDR 400 Гбит/с | 2 порта 400G, разнесённые по CPU-socket | OSFP | Двухсокетные узлы с 8 GPU и rail-optimized |
| Модель | Поколение | Порты | Форм-фактор | Роль в кластере |
|---|---|---|---|---|
| Quantum QM8700 | HDR 200 Гбит/с (managed) | 40 портов HDR | 1U | Автономная фабрика без внешнего SM, x86 CPU, HPC-кластеры на A100 |
| Quantum QM8790 | HDR 200 Гбит/с (unmanaged / externally managed) | 40 портов HDR | 1U | Только через внешний OpenSM или NVIDIA UFM, крупные фабрики |
| Quantum-2 QM9700 | NDR 400 Гбит/с (managed) | 64 порта NDR | 1U | Автономная фабрика, встроенный SM, Intel Core i3, Fat-Tree под 8–64 узла H100/H200 |
| Quantum-2 QM9790 | NDR 400 Гбит/с (unmanaged / externally managed) | 64 порта NDR | 1U | Только через внешний OpenSM/UFM, развёртывания свыше 2000 узлов |
| Тип | Длина | Куда применяем | Комментарий |
|---|---|---|---|
| Passive DAC OSFP | 0,5–3 м | Внутри стойки, GPU-узел ↔ leaf-коммутатор той же стойки | Дешевле, без питания, минимальная латентность |
| AOC OSFP | 3–100 м | Между соседними стойками, leaf ↔ spine в разных рядах | Активная оптика встроенная, готовое решение |
| Трансиверы OSFP 200G/400G + MPO-оптика | 50–300 м и более | Крупные соединения между рядами, отдельные ЦОД-модули | Максимальная длина, требует расчёта световой линии |
Заявка и обследование: 3–5 дней
число узлов, модель GPU, задачи, планы роста
Расчёт топологии, спецификация: 7–10 дней
Fat-Tree на N узлов, число leaf/spine, число портов, длины кабелей
Согласование, договор
по графику клиента
Поставка оборудования: 40–70 дней
HCA, коммутаторы, OSFP-кабели, лицензии UFM при необходимости
Монтаж, настройка: 5–10 дней
монтаж в стойки, кабельные работы, коммутация
Сдача, гарантия и постпродажное сопровождение
2–3 рабочих дня

Фабрика целиком
проектируем и поставляем фабрику целиком, а не собираем связку поштучно

Опыт
опыт Fat-Tree топологий на 4–128 GPU-узлов, экспертиза rail-optimized routing и тюнинга NCCL под конкретный workload
IB или RoCEv2
даём и IB-сценарий, и альтернативу 400 GbE + RoCEv2 — сравнение по TCO и производительности

Вендоры и поставщики
полностью замещённой альтернативы InfiniBand-компонентам в реестре Минпромторга нет, для чувствительных заказчиков раскладываем два сценария. Работа по 44-ФЗ и 223-ФЗ, пакет документов для закупки

Постпродажное сопровождение
мониторинг фабрики, разбор congestion-инцидентов, тюнинг NCCL под новые workloads

Пришлите число GPU-узлов, модель GPU, тип задач (pre-training, fine-tuning, HPC) и планы роста на 3–5 лет — по итогам заявки и расчёта (10–15 рабочих дней) вернёмся с топологией Fat-Tree, спецификацией HCA, коммутаторов и кабелей, лицензией UFM при необходимости и сроком поставки
Тремя вещами. Порт-порт латентность на порядок ниже (~100 нс против 600–800 нс на 400 GbE). RDMA нативный, без танцев с PFC и ECN. GPUDirect RDMA — эталонная реализация, NCCL коллективы работают из коробки. За это платят более высокой ценой на порт и специализированной инфраструктурой отдельно от Ethernet.
32 узла × 8 GPU × 400 Гбит/с = около 102 Тбит/с теоретически. Практический минимум для non-blocking Fat-Tree — около 50 Тбит/с bisection: хватает, чтобы NCCL all-reduce не стал узким местом при типовых batch size.
64 узла × 2 порта = 128 downlink + 128 uplink к spine. Ёмкость QM9700 — 64 порта. Итого 4 leaf + 4 spine, 8 коммутаторов для non-blocking Fat-Tree. Плюс дублированный Subnet Manager на managed-моделях или отдельным сервером с UFM.
Данные из VRAM одного GPU попадают в VRAM другого напрямую по фабрике, минуя CPU и системную оперативную память. По измерениям на NCCL all-reduce — снижение latency на 30–40% против классической схемы через TCP и CPU. Для моделей с частыми синхронизациями разница на wall-clock времени обучения ощутимая.
OpenSM — open-source, бесплатный, работает под HPC-нагрузки до 32 узлов без нареканий. UFM — коммерческий продукт NVIDIA с телеметрией, обнаружением congestion, GUI и API. Начиная с 32–48 узлов UFM окупается за счёт видимости состояния фабрики и раннего обнаружения деградаций.
Смысл есть, если задачи не флагманский pre-training LLM. HDR на A100 и HPC-симуляциях экономически оправдан ещё несколько лет: производительность сохраняется, стоимость на порт ниже. Для новых кластеров под H100/H200 берём сразу NDR, XDR закладываем как перспективу апгрейда через 3–5 лет.

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.