8 (800) 302-34-73

Коммутаторы InfiniBand HDR 200 Гбит/с

InfiniBand HDR 200 Гбит/с — зрелое поколение фабрики, оправданное для GPU-кластеров на A100, HPC-задач и стартовых ML-платформ, где NDR избыточен и дороже. Разбираем модели NVIDIA Quantum (QM8700 и QM8790), считаем число leaf- и spine-коммутаторов под целевую Fat-Tree, подбираем QSFP56-кабели по длинам трасс, настраиваем Subnet Manager и объясняем, когда стоит рассматривать шаг к NDR. Товар не храним, поставка идёт под конкретный проект под ваше ТЗ

{ серверы }

Когда HDR 200G оправдан, а когда пора смотреть на NDR

HPC-кластеры

HPC-кластеры

HPC-кластеры на A100 SXM или A100 PCIe — карте A100 хватает пропускной HDR (2 порта HDR на узел = 400 Гбит/с в фабрику), NDR даёт незначительный прирост при большей стоимости

Стартовые ML-платформы

Стартовые ML-платформы

Стартовые ML-платформы 4–8 узлов с фиксированным размером — экономический смысл в HDR за счёт зрелой цены и готовности стека

HDR-фабрика

HDR-фабрика

Расширение существующей HDR-фабрики — совместимость с ConnectX-6 HCA, которые уже стоят в узлах

HPC не-LLM задачи

HPC не-LLM задачи

CFD, молекулярная динамика, климатическое моделирование — трафик менее плотный, HDR закрывает

Оставьте заявку и получите бесплатную консультацию

{ отличия }

Модели Quantum в линейке HDR

ПараметрQM9700 (managed, встроенный Subnet Manager)QM9790 (unmanaged / externally managed)
Форм-фактор1U rackmount1U rackmount
Порты HDR 200G40 портов QSFP5640 портов QSFP56
Совокупная пропускная16 Тбит/с16 Тбит/с
HDR100 mode80 портов HDR100 через split (по 2 линии HDR)80 портов HDR100 через split
Латентность port-to-port~90–130 нс~90–130 нс
Subnet ManagerВстроенный (может работать без внешнего SM)Внешний (OpenSM или NVIDIA UFM)
Когда выбираютМалые фабрики. Отказоустойчивость (второй managed как standby SM)Средние и крупные HDR-фабрики с единым внешним UFM — единая точка мониторинга
Питание типовое~700–900 Вт~700–900 Вт
ОхлаждениеВоздух front-to-backВоздух front-to-back
{ критерии }

HDR 200G vs NDR 400G — как выбирают поколение

Число узловDownlink-портов (2 HCA × узлы)Leaf-коммутаторовSpine-коммутаторовИтого QM8700/QM8790
4 узла81 (single-tier)01
8 узлов161 (single-tier)01
16 узлов321 (single-tier, почти полный)01
20 узлов401 (single-tier, полный на 40 портах)01
32 узла644 (по 16 downlink + 16 uplink)4 (по 16 uplink)8
64 узла1288 (по 16 downlink + 16 uplink)8 (по 16 uplink)16
128 узлов25616 (по 16 downlink + 16 uplink)16 (по 16 uplink)32
{ расчёт }

Как считаем конфигурацию под целевое число узлов

Число узлов (8 GPU каждый)Downlink-портов нужноLeafSpineИтого QM9700
4 узла4 × 2 = 81 (single-tier)01
8 узлов8 × 2 = 161 (single-tier)01
16 узлов16 × 2 = 321 (single-tier, полный)01
32 узла32 × 2 = 642 (32 downlink + 32 uplink)2 (32 uplink от каждого leaf)4
64 узла64 × 2 = 1284 (32 downlink + 32 uplink)4 (32 uplink)8
128 узлов128 × 2 = 2568 (32 downlink + 32 uplink)8 (32 uplink)16
{ комплектация }

Что входит в поставку?

Коммутаторы Quantum QM8700 или QM8790
Трансиверы QSFP56 и кабели
Проектирование топологии Fat-Tree
Кабельный журнал и схема rail-optimized routing
Лицензия и настройка Subnet Manager
Монтаж в стойки, коммутация, включение SM, настройка MTU 4KB
Приёмочные тесты на реальном числе узлов
Пакет документов для 44-ФЗ и 223-ФЗ при госзаказе
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Заявка и уточнение: 2–4 дня

    число узлов, HCA-порты HDR, целевая топология, ЦОД

  2. 2 этап

    Расчёт: 5–7 дней

    число QM8700/QM8790, роли leaf/spine, длины QSFP56-кабелей, лицензия UFM

  3. 3 этап

    Согласование, договор

    по графику клиента

  4. 4 этап

    Поставка коммутаторов и кабелей: 35–60 дней

    HDR — зрелое поколение, сроки короче NDR

  5. 5 этап

    Монтаж и настройка: 5–10 дней

    Монтаж в стойки, кабельные работы, коммутация в топологию

  6. 6 этап

    Приёмочные тесты, сдача, гарантия и постпродажное сопровождение

    2–3 рабочих дня

{ под ключ }

Почему выбирают нас?

HDR-фабрика под рост кластера

проектируем HDR-фабрику под целевое число узлов и планы роста — не «выдали коммутатор и уходим»

Опыт

опыт с Quantum QM8700/QM8790 в кластерах 4–128 узлов, включая гибридные HDR + EDR

Выбор коммутатора

даём выбор между HDR (для A100 и HPC) и NDR (для H100/H200 и pre-training) с расчётом TCO

Вендоры и поставщики

коммутаторы HDR: NVIDIA (бывшая Mellanox) — Quantum QM8700 и QM8790. Трансиверы и кабели QSFP56: NVIDIA, FS.com (эквиваленты), российские интеграторы. Лицензия UFM — NVIDIA. Импортозамещение честно: InfiniBand-компоненты Quantum фактически NVIDIA-only

Постпродажное сопровождение

помогаем администратору фабрики с UFM, обновлениями прошивок и расширением по мере роста числа узлов. Работаем по 44-ФЗ и 223-ФЗ, готовим пакет документов для закупки

{ свяжитесь с нами }

Пришлите ТЗ — вернёмся с топологией и числом коммутаторов

Пришлите число GPU-узлов, модель GPU (A100 или H100) и планы роста на 3–5 лет — по итогам расчёта (7–11 рабочих дней) вернёмся с топологией Fat-Tree, числом QM8700/QM8790, длинами QSFP56-кабелей, лицензией UFM при необходимости и сроком поставки. План монтажа и приёмочные NCCL-бенчмарки — после поставки оборудования, с фиксированным сроком сдачи. Пакет документов под 44-ФЗ при госзаказе

{ FAQ }

Часто задаваемые вопросы

Есть, если целевые GPU — A100 или задача — HPC. Карте A100 хватает пропускной HDR (2 порта × 200 Гбит/с = 400 Гбит/с в фабрику), NDR даёт незначительный прирост при большей стоимости. Для флагманских ML-кластеров на H100/H200 сразу закладываем NDR, там разница по NCCL-скорости на wall-clock времени обучения заметная.

32 × 2 = 64 downlink-порта. Под non-blocking 1:1 нужно 64 uplink к spine. QM8700 несёт 40 портов HDR — практический расчёт с запасом даёт 4 leaf по 16 downlink и 16 uplink и 4 spine по 16 uplink каждый. Итого 8 коммутаторов Quantum QM8700 плюс сервер под UFM или дублированный QM8700 в роли Subnet Manager.

Только в Subnet Manager. QM8700 работает автономно со встроенным SM — удобно для малых и средних фабрик до 16 узлов. QM8790 требует внешнего OpenSM или NVIDIA UFM — стандартный выбор для крупных кластеров с единой точкой мониторинга. Физика (порты, латентность 90–130 нс, пропускная 16 Тбит/с) идентична.

Да, downlink к HDR-узлам работает через NDR-коммутатор со split-mode. Но общая пропускная сегмента упирается в HDR: смешанная фабрика не даст преимуществ NDR тем узлам, которые остались на HDR. Для гибридной инфраструктуры лучше сегментировать: NDR-часть под H100/H200, HDR-часть под A100 и HPC.

Реалистично 35–60 рабочих дней от даты договора — HDR более зрелое поколение, сроки поставки прогнозируемые и короче NDR (у NDR — 45–75 дней). Общий срок сдачи HDR-части (проект + поставка + монтаж + приёмочные тесты) — 50–80 рабочих дней.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.