8 (800) 302-34-73

Как выбрать InfiniBand-оборудование для GPU-кластера

22 сентября 2026 г.

Выбор InfiniBand-оборудования для GPU-кластера зависит от пропускной способности, совместимости компонентов и масштаба. Правильный подход учитывает поколение портов, портовую емкость и кабельные тракты, а не только отдельные параметры.

Как выбрать InfiniBand-оборудование для GPU-кластера

Как выбрать InfiniBand, если архитектура GPU-кластера уже определена, но в спецификациях десятки похожих параметров? Сравнение стоит начинать не с цены отдельного устройства, а с пропускной способности всей фабрики и совместимости ее звеньев. Адаптер соединяется с коммутатором через кабель и образует единый тракт — экономия на одной позиции способна ограничить остальные. Правильный выбор опирается на масштаб кластера и требуемую задержку — план расширения важнее максимальной цифры в рекламном описании.

Архитектура InfiniBand-кластера с многоуровневой топологией коммутаторов, leaf- и spine-уровни, серверы с GPU в стойках, кабельная коммутация

Какие параметры коммутатора InfiniBand важны для GPU-кластера

InfiniBand-коммутатор для GPU-кластера сравнивают в первую очередь по скорости порта. Для поколений HDR ориентиром служит до 200 Гбит/с, для NDR — до 400 Гбит/с. Эти значения нужно сопоставлять со скоростью адаптеров в серверах. Если узел подключен интерфейсом предыдущего поколения, более быстрый порт коммутатора не увеличит пропускную способность этого соединения. Обратная ситуация тоже нежелательна: современный адаптер будет работать в режиме медленного сетевого звена.

Сравнение по классам портов:

Классы портов InfiniBand

КлассСкорость на портЗадержка коммутацииТиповое применение
HDRдо 200 Гбит/сниже: NRZ-кодирование, FEC не требуетсядействующие фабрики, апгрейд без замены оптики
NDRдо 400 Гбит/свыше, чем у HDR: PAM4 требует обязательного FECновые фабрики с плотной all-reduce нагрузкой, spine-уровень

Второй параметр — портовая емкость. Посчитайте нисходящие соединения к серверам и отдельно зарезервируйте аплинки. В небольшой схеме все узлы могут подключаться к одному устройству, но при переходе к многоуровневой фабрике часть портов потребуется для связи leaf- и spine-уровней. Поэтому коммутаторы InfiniBand-класса сравнивают не только по общему числу разъемов, но и по тому, сколько из них останется доступно после построения требуемой топологии.

Обратите внимание на задержку коммутации и поддержку адаптивной маршрутизации — подробный механизм разберем в разделе про недооцененные параметры. Функция полезна только при корректной настройке всей фабрики, поэтому наличие пункта в спецификации само по себе не гарантирует результат.

В техническое задание входят и практические параметры: охлаждение и направление воздушного потока, доступность резервных блоков питания и вариант управления. Отдельно учитывайте сертификацию оборудования и резервирование каналов как самостоятельный пункт, отдельный от резервирования питания. Эти свойства не ускоряют сеть напрямую, но определяют, можно ли установить устройство в существующую стойку и обслуживать его по правилам площадки.

Коммутатор InfiniBand с активными портами, индикаторы состояния, плотное расположение интерфейсов, современная сетевая инфраструктура

Как выбрать сетевой адаптер для InfiniBand-кластера

InfiniBand-адаптер должен совпадать с коммутатором по поддерживаемому поколению и режиму порта. Оценивают число интерфейсов на карте и ширину подключения к серверу. Важно, чтобы внутренняя шина не ограничивала сетевую скорость. Для многокарточного узла дополнительно проверяют, как адаптеры распределены между процессорными сокетами и линиями PCIe.

В ИИ-инфраструктуре сетевой тракт связан с расположением GPU. При rail-optimized дизайне число адаптеров подстраивается под число ускорителей, а не под один общий порт сервера. Узел на восемь GPU может потребовать восемь независимых сетевых путей. Такой подход уменьшает конкуренцию карт за полосу и делает межузловой обмен симметричным. Сетевые карты для ИИ-инфраструктуры в этом случае подбирают как часть топологии, а не как универсальную плату для каждого сервера.

Поддержка RDMA обязательна для задач, где приложение использует прямой доступ к памяти. Для GPUDirect RDMA также нужна совместимость драйверов и программного стека. В техническом задании лучше фиксировать требуемые функции, а не только название интерфейса. Отдельно укажите версию операционной системы и CUDA, если среда уже утверждена.

Не смешивайте адаптеры разных классов без схемы их использования. Если часть узлов получает один сетевой путь, а другая — несколько, коллективные операции будут ограничиваться более медленной группой. Разнородность допустима для служебных или тестовых серверов, но вычислительный контур желательно проектировать одинаково.

Медь или оптика: как выбрать кабель по дистанции применения

Медные DAC-сборки подходят для коротких расстояний, обычно внутри одной стойки или между соседними стойками. Они не требуют отдельных трансиверов и часто обходятся дешевле в пересчете на порт. При небольшой длине трассы это простой способ получить требуемый режим соединения с минимальным числом компонентов.

Оптика нужна, когда расстояние превышает возможности медной сборки или кабель проходит между удаленными рядами. Она дороже, поскольку включает трансиверы и волоконную линию. Зато сигнал сохраняется на большей длине, а трасса может быть легче и удобнее для плотной кабельной инфраструктуры. Конкретный тип волокна выбирают по характеристикам трансивера и требованиям площадки.

Кабельные сборки DAC и breakout-варианты применяют, когда один высокоскоростной порт нужно разделить на несколько соединений поддерживаемого режима. Breakout нельзя закладывать только по форме разъема: коммутатор и адаптер должны поддерживать выбранное разбиение. В спецификации указывают длину и тип оконцовки. Требуемую скорость фиксируют для каждого ответвления.

Перед заказом полезно составить таблицу кабельных трасс. Для каждого соединения зафиксируйте начальную и конечную точку. Отдельно укажите расчетную длину с технологическим запасом. Такой документ выявляет места, где медь уже не подходит, и снижает риск закупки одинаковых сборок для разных расстояний.

Аппаратное обеспечение центра обработки данных: кабельные тракты, медные DAC и оптические кабели в каналах, серверные стойки с подключениями

Адаптивная маршрутизация и другие параметры, которые упускают при выборе

Адаптивная маршрутизация помогает фабрике использовать альтернативные пути при неравномерной нагрузке. Это особенно заметно в fat-tree, где между leaf- и spine-коммутаторами есть несколько равноценных направлений. Без динамического выбора часть каналов может перегружаться, пока соседние остаются недоиспользованными. В GPU-кластере это напрямую влияет на коллективные операции, где множество узлов обменивается данными одновременно.

Проверяйте поддержку функции не только в коммутаторе. Она зависит от программного обеспечения управления фабрикой и версии прошивки. Если оборудование закупается у разных поставщиков, заранее запросите матрицу совместимости. Обновление одной группы устройств после ввода в эксплуатацию не должно лишать сеть согласованного режима.

Еще один недооцененный параметр — телеметрия. Для диагностики нужны счетчики ошибок и загрузки портов. Полезна также видимость очередей и маршрутов. Без этих данных трудно отличить недостаток пропускной способности от неисправного кабеля или неверной настройки.

Срок поставки и доступность заменяемых компонентов влияют на архитектуру не меньше стоимости порта. Если кабель или трансивер поставляется месяцами, единичная неисправность может остановить расширение. В заказ разумно включить запас расходных компонентов и согласовать перечень совместимых замен.

Как сопоставить оборудование с масштабом кластера

Начните с числа GPU, затем определите число сетевых путей на узел. Для сервера на 8-10 видеокарт rail-optimized схема может потребовать сопоставимого числа адаптеров. После этого посчитайте все нисходящие порты коммутаторов. Только затем добавляйте аплинки и резерв под рост.

Для кластера до нескольких узлов может быть достаточно одного коммутатора с прямыми подключениями. При расширении до 16 узлов и более обычно появляется многоуровневая фабрика. Тогда портовая емкость расходуется быстрее, чем растет число серверов, поскольку нужны связи между уровнями. Ошибка на этом этапе приводит к покупке второго комплекта оборудования раньше запланированного срока.

Скорость выбирают по профилю задания. Если обучение регулярно выполняет крупные all-reduce операции, сеть должна выдерживать одновременную передачу между множеством GPU. Для менее связных задач допустима другая конфигурация. Нельзя выводить требуемое поколение только из числа ускорителей: два кластера одинакового размера могут создавать разный объем межузлового трафика.

Заложите сценарий расширения в схему портов и кабелей. Укажите целевой размер на первом этапе и предел масштабирования без замены коммутаторов. Такой подход позволяет сравнивать предложения по полной стоимости перехода, а не по стартовой цене.

Типичные ошибки закупки InfiniBand-оборудования

На практике встречаются четыре повторяющиеся ошибки закупки:

  1. Смешение HDR и NDR без понимания, где произойдет снижение скорости. Совместимость на уровне физического соединения не означает сохранение максимального режима. В спецификации должен быть показан каждый путь от адаптера до коммутатора и его расчетная пропускная способность. Обнаруживается это не при приемке, а на первом нагрузочном тесте all-reduce: пропускная способность фабрики оказывается ниже паспортной у самого быстрого звена.
  2. Подсчет только серверных портов. Аплинки к spine-уровню и резервирование тоже занимают разъемы. Коммутатор, который выглядит достаточным по числу узлов, может оказаться заполненным сразу после сборки первой версии fat-tree. Проявляется при добавлении второго ряда стоек: свободных портов для аплинков не остается, и коммутатор докупают вне бюджета.
  3. Единый тип кабеля для всех трасс. Короткие соединения выгодно выполнять медью, а длинные требуют оптики. Унификация ради простоты заказа может увеличить стоимость или привести к неподходящим длинам. Лучше унифицировать не все кабели, а ограниченный набор проверенных типов для каждой зоны. Обнаруживается на этапе прокладки: часть трасс не укладывается в паспортную длину медной сборки, и кабель докупают повторно, уже с трансиверами.
  4. Закупка адаптеров без проверки серверной платформы. Нужно учесть свободные слоты и линии PCIe. Отдельно проверяют охлаждение карт и расположение GPU. Если сервер физически не поддерживает требуемое число адаптеров, rail-optimized схема останется только на бумаге. Выявляется при монтаже: часть адаптеров не помещается в слоты или конфликтует по PCIe с уже установленными картами.

Перед согласованием заказа проверьте пять пунктов, из которых чаще всего вырастают доработки уже после монтажа фабрики:

  • Поколение портов;
  • Число нисходящих соединений;
  • Запас аплинков;
  • Типы кабелей;
  • программную совместимость.

Такой чек-лист переводит выбор из сравнения прайсов в проверяемое техническое решение. Если хотя бы один пункт не подтвержден схемой или матрицей совместимости, спецификацию стоит вернуть на уточнение до закупки. Отдельно зафиксируйте, кто подтверждает совместимость — поставщик коммутатора или интегратор: без явного распределения ролей проверка размывается между сторонами сделки.