Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

Коммутаторы InfiniBand 400 Гбит/с (NDR)

Коммутатор InfiniBand 400 Гбит/с — актуальное поколение NDR для флагманских GPU-кластеров на H100/H200. Разбираем модели NVIDIA Quantum-2 (QM9700 и QM9790), считаем число leaf- и spine-коммутаторов под целевую Fat-Tree, подбираем OSFP-кабели по длинам трасс и настраиваем Subnet Manager, показываем, что входит в поставку и в какой срок. Товар не храним — поставка идёт под конкретный проект и его сроки. Работаем под ваше ТЗ
Главная
/
/
/
InfiniBand 400
Назад
H100/H200 без bottleneck
Кластер на H100/H200 SXM с двумя HCA-портами на узел (rail-optimized) — только NDR обеспечит non-blocking Fat-Tree без bottleneck
Ускорение NCCL-коммуникаций
NCCL-нагрузка составляет 30–50% времени обучения — переход HDR → NDR ускоряет фазу коммуникаций примерно вдвое
Пропускная способность
Крупные LLM 70B+ с высокими объёмами all-reduce трафика — только NDR даёт нужную bisection bandwidth
Запас под рост кластера
Планируется рост кластера на 3–5 лет — NDR даёт запас пропускной и совместимость вниз с HDR/EDR
Оставьте заявку и получите бесплатную консультацию

Когда бизнесу нужен свой сервер H100 или H200

{ серверы }

Модели Quantum-2 в линейке NDR

{ отличия }
Параметр QM9700 (managed, встроенный Subnet Manager) QM9790 (unmanaged / externally managed)
Форм-фактор 1U rackmount 1U rackmount
Физические порты OSFP 32 (каждый OSFP = 2 порта NDR) 32 (каждый OSFP = 2 порта NDR)
Эффективная портовая ёмкость (NDR) 64 порта NDR 400 Гбит/с (split-mode) 64 порта NDR 400 Гбит/с (split-mode)
Совокупная пропускная 51,2 Тбит/с 51,2 Тбит/с
Латентность port-to-port ~90–130 нс ~90–130 нс
Subnet Manager Встроенный (может работать без внешнего SM) Внешний (OpenSM или NVIDIA UFM)
Когда выбирают Малые/средние фабрики, отказоустойчивость (второй managed как standby SM) Крупные кластеры с внешним UFM — единая точка управления фабрикой
Питание типовое ~1000–1500 Вт ~1000–1500 Вт
Охлаждение Воздух front-to-back Воздух front-to-back

Роли коммутаторов в топологии Fat-Tree

{ критерии }
Роль Куда подключён Соотношение downlink/uplink Комментарий
Leaf (Top-of-Rack, ToR) Downlink — к GPU-узлам (HCA ConnectX-7), uplink — к spine 32 downlink + 32 uplink (non-blocking 1:1) Rail-optimized: каждый GPU в узле идёт в «свой» leaf для NCCL
Spine (Aggregation) Только к leaf (все порты вверх) Все 64 порта как uplink Число spine определяется требованием non-blocking + числом leaf
Single-tier (1 коммутатор на кластер) Только к GPU-узлам напрямую Все 64 порта как downlink Работает до ~4 узлов с 8 GPU + 2 HCA-порта (=64 линии) без oversubscription
Managed с внешним SM (QM9790 + UFM) Отдельный сервер под UFM в кластере Единая точка мониторинга и routing

Как считаем конфигурацию под целевое число узлов

{ расчёт }
Число узлов (8 GPU каждый) Downlink-портов нужно Leaf Spine Итого QM9700
4 узла 4 × 2 = 8 1 (single-tier) 0 1
8 узлов 8 × 2 = 16 1 (single-tier) 0 1
16 узлов 16 × 2 = 32 1 (single-tier, полный) 0 1
32 узла 32 × 2 = 64 2 (32 downlink + 32 uplink) 2 (32 uplink от каждого leaf) 4
64 узла 64 × 2 = 128 4 (32 downlink + 32 uplink) 4 (32 uplink) 8
128 узлов 128 × 2 = 256 8 (32 downlink + 32 uplink) 8 (32 uplink) 16

Что входит в поставку?

{ комплектация }
Коммутаторы Quantum-2 QM9700 или QM9790
Трансиверы OSFP 400G и кабели
Проектирование топологии Fat-Tree
Кабельный журнал и схема rail-optimized routing
Лицензия и настройка Subnet Manager
Монтаж в стойки, коммутация, настройка
Приёмочные тесты на реальном числе узлов
Пакет документов для 44-ФЗ и 223-ФЗ при госзаказе
Заказать консультацию
число узлов, HCA-порты, целевая топология, ЦОД
Заявка и уточнение: 2–4 дня
число QM9700/QM9790, роли leaf/spine, длины кабелей OSFP, лицензия UFM
Расчёт: 5–7 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
Монтаж в стойки, кабельные работы, коммутация в топологию
Монтаж, настройка: 5–10 дней
3 этап
5 этап
2 этап
Поставка коммутаторов и OSFP-кабелей/трансиверов
Поставка: 45–75 дней
2–3 рабочих дня
Приёмочные тесты, сдача, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас?

{ под ключ }
проектируем топологию Fat-Tree под целевое число узлов и планы роста, не «выдали коммутатор и уходим»
Fat-Tree под масштабирование кластера
Постпродажное сопровождение
помогаем администратору фабрики с UFM, обновлениями прошивок Quantum-2 и расширением по мере роста числа GPU-узлов
Вендоры и поставщики
коммутаторы NDR: NVIDIA (бывшая Mellanox) — Quantum-2 QM9700 и QM9790. Трансиверы и кабели OSFP: NVIDIA, FS.com (эквиваленты), российские интеграторы. Лицензия UFM — NVIDIA. OpenSM — open-source без лицензионных сборов
даём выбор: QM9790 + внешний UFM для крупных фабрик или QM9700 для стартовых сценариев
Выбор коммутатора
Опыт
опыт с Quantum-2 в кластерах 4–128 узлов, включая rail-optimized routing под NCCL
Пришлите число GPU-узлов, число HCA-портов на узел и планы роста на 3–5 лет — по итогам заявки и расчёта (7–11 рабочих дней) вернёмся с топологией Fat-Tree, числом QM9700/QM9790, длинами OSFP-кабелей, лицензией UFM при необходимости и сроком поставки. План монтажа и приёмочные NCCL-бенчмарки после поставки оборудования, с фиксированным сроком сдачи. Пакет документов под 44-ФЗ при госзаказе

Пришлите ТЗ — вернёмся с топологией и числом коммутаторов

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Только в Subnet Manager. QM9700 работает автономно со встроенным SM — удобно для малых и средних фабрик до ~2000 узлов. QM9790 требует внешнего OpenSM или NVIDIA UFM — стандартный выбор для крупных кластеров с единой точкой управления. Физика (порты, латентность 90–130 нс, пропускная 51,2 Тбит/с) идентична.