8 (800) 302-34-73

Коммутаторы InfiniBand 400 Гбит/с (NDR)

Коммутатор InfiniBand 400 Гбит/с — актуальное поколение NDR для флагманских GPU-кластеров на H100/H200. Разбираем модели NVIDIA Quantum-2 (QM9700 и QM9790), считаем число leaf- и spine-коммутаторов под целевую Fat-Tree, подбираем OSFP-кабели по длинам трасс и настраиваем Subnet Manager, показываем, что входит в поставку и в какой срок. Товар не храним — поставка идёт под конкретный проект и его сроки. Работаем под ваше ТЗ

{ серверы }

Когда бизнесу нужен свой сервер H100 или H200

H100/H200 без bottleneck

H100/H200 без bottleneck

Кластер на H100/H200 SXM с двумя HCA-портами на узел (rail-optimized) — только NDR обеспечит non-blocking Fat-Tree без bottleneck

Запас под рост кластера

Запас под рост кластера

Планируется рост кластера на 3–5 лет — NDR даёт запас пропускной и совместимость вниз с HDR/EDR

Ускорение NCCL-коммуникаций

Ускорение NCCL-коммуникаций

NCCL-нагрузка составляет 30–50% времени обучения — переход HDR → NDR ускоряет фазу коммуникаций примерно вдвое

Пропускная способность

Пропускная способность

Крупные LLM 70B+ с высокими объёмами all-reduce трафика — только NDR даёт нужную bisection bandwidth

Оставьте заявку и получите бесплатную консультацию

{ отличия }

Модели Quantum-2 в линейке NDR

ПараметрQM9700 (managed, встроенный Subnet Manager)QM9790 (unmanaged / externally managed)
Форм-фактор1U rackmount1U rackmount
Физические порты OSFP32 (каждый OSFP = 2 порта NDR)32 (каждый OSFP = 2 порта NDR)
Эффективная портовая ёмкость (NDR)64 порта NDR 400 Гбит/с (split-mode)64 порта NDR 400 Гбит/с (split-mode)
Совокупная пропускная51,2 Тбит/с51,2 Тбит/с
Латентность port-to-port~90–130 нс~90–130 нс
Subnet ManagerВстроенный (может работать без внешнего SM)Внешний (OpenSM или NVIDIA UFM)
Когда выбираютМалые/средние фабрики, отказоустойчивость (второй managed как standby SM)Крупные кластеры с внешним UFM — единая точка управления фабрикой
Питание типовое~1000–1500 Вт~1000–1500 Вт
ОхлаждениеВоздух front-to-backВоздух front-to-back
{ критерии }

Роли коммутаторов в топологии Fat-Tree

РольКуда подключёнСоотношение downlink/uplinkКомментарий
Leaf (Top-of-Rack, ToR)Downlink — к GPU-узлам (HCA ConnectX-7), uplink — к spine32 downlink + 32 uplink (non-blocking 1:1)Rail-optimized: каждый GPU в узле идёт в «свой» leaf для NCCL
Spine (Aggregation)Только к leaf (все порты вверх)Все 64 порта как uplinkЧисло spine определяется требованием non-blocking + числом leaf
Single-tier (1 коммутатор на кластер)Только к GPU-узлам напрямуюВсе 64 порта как downlinkРаботает до ~4 узлов с 8 GPU + 2 HCA-порта (=64 линии) без oversubscription
Managed с внешним SM (QM9790 + UFM)Отдельный сервер под UFM в кластере—Единая точка мониторинга и routing
{ расчёт }

Как считаем конфигурацию под целевое число узлов

Число узлов (8 GPU каждый)Downlink-портов нужноLeafSpineИтого QM9700
4 узла4 × 2 = 81 (single-tier)01
8 узлов8 × 2 = 161 (single-tier)01
16 узлов16 × 2 = 321 (single-tier, полный)01
32 узла32 × 2 = 642 (32 downlink + 32 uplink)2 (32 uplink от каждого leaf)4
64 узла64 × 2 = 1284 (32 downlink + 32 uplink)4 (32 uplink)8
128 узлов128 × 2 = 2568 (32 downlink + 32 uplink)8 (32 uplink)16
{ комплектация }

Что входит в поставку?

Коммутаторы Quantum-2 QM9700 или QM9790
Трансиверы OSFP 400G и кабели
Проектирование топологии Fat-Tree
Кабельный журнал и схема rail-optimized routing
Лицензия и настройка Subnet Manager
Монтаж в стойки, коммутация, настройка
Приёмочные тесты на реальном числе узлов
Пакет документов для 44-ФЗ и 223-ФЗ при госзаказе
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Заявка и уточнение: 2–4 дня

    число узлов, HCA-порты, целевая топология, ЦОД

  2. 2 этап

    Расчёт: 5–7 дней

    число QM9700/QM9790, роли leaf/spine, длины кабелей OSFP, лицензия UFM

  3. 3 этап

    Согласование, договор

    по графику клиента

  4. 4 этап

    Поставка: 45–75 дней

    Поставка коммутаторов и OSFP-кабелей/трансиверов

  5. 5 этап

    Монтаж, настройка: 5–10 дней

    Монтаж в стойки, кабельные работы, коммутация в топологию

  6. 6 этап

    Приёмочные тесты, сдача, гарантия и постпродажное сопровождение

    2–3 рабочих дня

{ под ключ }

Почему выбирают нас?

Fat-Tree под масштабирование кластера

проектируем топологию Fat-Tree под целевое число узлов и планы роста, не «выдали коммутатор и уходим»

Опыт

опыт с Quantum-2 в кластерах 4–128 узлов, включая rail-optimized routing под NCCL

Выбор коммутатора

даём выбор: QM9790 + внешний UFM для крупных фабрик или QM9700 для стартовых сценариев

Вендоры и поставщики

коммутаторы NDR: NVIDIA (бывшая Mellanox) — Quantum-2 QM9700 и QM9790. Трансиверы и кабели OSFP: NVIDIA, FS.com (эквиваленты), российские интеграторы. Лицензия UFM — NVIDIA. OpenSM — open-source без лицензионных сборов

Постпродажное сопровождение

помогаем администратору фабрики с UFM, обновлениями прошивок Quantum-2 и расширением по мере роста числа GPU-узлов

{ свяжитесь с нами }

Пришлите ТЗ — вернёмся с топологией и числом коммутаторов

Пришлите число GPU-узлов, число HCA-портов на узел и планы роста на 3–5 лет — по итогам заявки и расчёта (7–11 рабочих дней) вернёмся с топологией Fat-Tree, числом QM9700/QM9790, длинами OSFP-кабелей, лицензией UFM при необходимости и сроком поставки. План монтажа и приёмочные NCCL-бенчмарки после поставки оборудования, с фиксированным сроком сдачи. Пакет документов под 44-ФЗ при госзаказе

{ FAQ }

Часто задаваемые вопросы

Только в Subnet Manager. QM9700 работает автономно со встроенным SM — удобно для малых и средних фабрик до ~2000 узлов. QM9790 требует внешнего OpenSM или NVIDIA UFM — стандартный выбор для крупных кластеров с единой точкой управления. Физика (порты, латентность 90–130 нс, пропускная 51,2 Тбит/с) идентична.

32 узла × 2 HCA-порта = 64 downlink-порта. Под non-blocking 1:1 нужно 64 uplink к spine. QM9700 несёт 64 порта NDR — итого 2 leaf по 32 downlink + 32 uplink и 2 spine, каждый принимает по 32 uplink от leaf. Всего 4 коммутатора QM9700. Плюс сервер под UFM или дублированный QM9700 в роли Subnet Manager.

Физически на QM9700 32 OSFP-разъёма, но каждый OSFP несёт две линии NDR — итого 64 порта NDR 400G в split-mode. Без него коммутатор давал бы 32 порта 800G, что не совместимо с современными HCA ConnectX-7 (у них порты по 400G). Split-mode — стандартный режим для NDR-развёртываний.

Да, downlink к HDR-узлам работает — Quantum-2 совместимы с HDR 200G и EDR 100G. Но общая пропускная упирается в HDR: сегменты с HDR-узлами не получат преимуществ NDR. Для смешанной фабрики лучше сегментировать: NDR-часть под H100/H200, HDR-часть под A100 и HPC-нагрузки.

Реалистично 45–75 рабочих дней от даты договора. Товар не храним, поставка под конкретный проект. Общий срок сдачи (проект + поставка + монтаж + приёмочные тесты) — 60–95 рабочих дней.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.