Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

GPU-кластер для обучения нейросетей

GPU-кластер для обучения нейросетей нужен, когда клиент упирается в границы одного узла: модель не помещается даже в H200 141 ГБ, батч не даёт нужной точности, а эксперимент, который должен занимать день, растягивается на неделю. Собираем связку от 2 до 128 узлов H100/H200/A100 SXM в HGX-платформах, соединённую InfiniBand-фабрикой Fat-Tree с rail-optimized routing под NCCL
Главная
/
/
/
GPU-кластер для обучения нейросетей
Назад
Модель больше одного узла
Модель не помещается в один узел (даже H200 141 ГБ HBM3e), нужен tensor parallel или pipeline parallel через несколько узлов
Общая СХД
Датасет превышает объём локального NVMe одного узла — нужна общая СХД с параллельной ФС для батчей эпох
Параллельная работа команд
Несколько ML-команд работают параллельно — один узел на всех превращается в очередь
Foundation-модели 70B+ и MoE
Целевая модель — foundation-модель 70B+ или mixture-of-experts (MoE) — один узел физически не тянет
Ускорение R&D
Эксперимент занимает неделю на одном узле — распределив на 8 узлов, ждёте день, для итеративного R&D это критично
Оставьте заявку и получите бесплатную консультацию

Когда одного узла мало и нужен кластер

{ сценарии }

Кластер vs один узел: что меняется в проекте

{ отличия }
Подсистема 1 узел (сервер) Кластер (2+ узлов)
GPU-связь NVLink Switch внутри узла (900 ГБ/с между 8 GPU) NVLink внутри узла + InfiniBand между узлами (400 Гбит/с NDR)
Сеть 1–2 порта Ethernet для управления Отдельная InfiniBand-фабрика Fat-Tree + Ethernet для управления
Коммутаторы Не нужны для GPU-трафика Quantum-2 QM9700 (NDR) или Quantum QM8700 (HDR), leaf + spine
Хранение Локальный NVMe в узле (2–8 ТБ) Локальный NVMe + общая параллельная ФС (Lustre / GPFS / BeeGFS)
Программное CUDA, драйверы, ML-фреймворк Плюс NCCL с rail-optimized и MTU 4 КБ, Subnet Manager (OpenSM или UFM), Slurm/Kubernetes, checkpoint-политика
Планировщик Локально запускаешь python train.py Slurm или Kubernetes с GPU-плагином, очереди, приоритеты, отказоустойчивость
Мониторинг nvidia-smi + журнал Prometheus + DCGM Exporter + мониторинг фабрики (UFM), сквозные дашборды
Питание 5–12 кВт на стойку 20–50 кВт на плотную сборку, часто DLC

Как считаем конфигурацию под задачу обучения

{ расчет }
Параметр подбора На что влияет Что уточняем у клиента
Размер обучаемой модели Выбор GPU (A100 40/80 vs H100 80 vs H200 141 ГБ), число узлов, тип параллелизма Целевой размер параметров, тип модели (dense vs MoE)
Тип распределённого обучения Требования к NCCL-пропускной, топология фабрики Data-parallel, model-parallel, pipeline, tensor
Число узлов сейчас и через 12–24 мес Число коммутаторов, топология, запас портов План роста, бюджет CapEx
Datalayout — размер и формат датасета Класс общей СХД, размер локального NVMe-кэша Объём датасета, формат (JPEG, TFRecord, parquet)
Поколение InfiniBand HDR 200G (для A100) vs NDR 400G (для H100/H200) Модель GPU в узле, планы обновления
Условия ЦОД Воздух (12 кВт/стойка) vs DLC (30–50 кВт) Мощность стойки, готовность к DLC
Планировщик задач Slurm (HPC-style) vs Kubernetes (cloud-native) Что уже используется, число команд-пользователей
Checkpoint-политика Требования к write-пропускной СХД, частота checkpointов Стоимость потерянного часа обучения
Отказоустойчивость обучения Дублирование Subnet Manager, hot-swap NVMe, N+N БП SLA внутренней ML-платформы

Три профиля масштаба кластера

{ конфигурации }
Compute
2–4 узла HGX 8×A100 или 8×H100 SXM
Сеть
1 коммутатор Quantum QM8700 (HDR 200G) для A100
Хранение
Локальный NVMe 8 ТБ в каждом узле, общая параллельная ФС на BeeGFS
Инженерка
2–3 стойки по 12 кВт, воздушное охлаждение
Стартовый кластер: 2–4 узла с 8×A100 SXM или 8×H100 SXM HGX
На что рассчитано: fine-tuning LLM 7B–70B, R&D-команда 5–15 инженеров, тестовая ML-платформа
Compute
8–32 узла HGX 8×H100 SXM
Сеть
Двухуровневая Fat-Tree non-blocking 1:1 на Quantum-2 QM9700
Хранение
Параллельная ФС Lustre/GPFS от 500 ТБ
Инженерка
4–8 стоек, часть воздух, часть DLC (20–30 кВт)
Продуктивный кластер: 8–32 узла с 8×H100 SXM HGX
На что рассчитано: full fine-tuning LLM 30B–70B, обучение foundation-моделей до 70B, командная ML-платформа с 30+ инженерами, гибрид обучение + периодический инференс
Compute
32–128 узлов HGX 8×H100 или 8×H200 SXM
Сеть
Полная Fat-Tree на Quantum-2 QM9700, UFM с телеметрией congestion
Хранение
Enterprise-параллельная ФС (Lustre / GPFS / VAST-класс), ярусы hot/warm/cold
Инженерка
Плотная DLC-сборка 30–50 кВт/стойка, чиллер или free-cooling
Крупный кластер: 32–128 узлов с 8×H100/H200 SXM HGX
На что рассчитано: pre-training foundation-моделей 70B–1T параметров, отраслевые LLM, крупные R&D-центры банков и корпораций

Подходы к распределённому обучению

{ нагрузка }
Подход Что параллелится Нагрузка на InfiniBand Когда применим
Data-parallel (PyTorch DDP, ZeRO-1) Батч делится между узлами, модель целиком на каждом Умеренная (all-reduce градиентов раз в шаг) Модель влезает в один узел (до 70B на H200)
ZeRO-2 / ZeRO-3 Оптимизатор + градиенты (ZeRO-2) или + веса (ZeRO-3) шардированы Высокая (all-gather + reduce-scatter каждый шаг) Модель не влезает в узел, экономим память
Tensor-parallel Матричные операции слоя делятся между GPU (обычно внутри узла через NVLink) Внутри узла — NVLink Switch, между узлами — очень высокая Крупные слои трансформера (Megatron-LM), 8 GPU в узле
Pipeline-parallel Слои модели распределены по узлам конвейером Умеренная (только на границах ступеней) Очень глубокие модели, компенсация memory-limit
3D-parallel (DP+TP+PP) Все три оси одновременно Смешанная, самая сложная в тюнинге Foundation-модели 70B+ (Megatron-LM + DeepSpeed)

Что входит в поставку?

{ комплектация }
Cобранные HGX-платформы, локальный NVMe
Коммутаторы в топологии Fat-Tree, HCA в каждом узле, кабели
Общая СХД под датасеты
Проект питания стойки и проект охлаждения
Программный стек и планировщик
Сквозные приёмочные тесты
Обучение, постпродажное сопровождение
Пакет документов под 44-ФЗ или 223-ФЗ при госзаказе
Заказать консультацию
задача обучения, целевая модель, объём датасетов, условия ЦОД, планы роста
Заявка и обследование: 5–7 дней
число и модель узлов, поколение InfiniBand и топология Fat-Tree, класс СХД, охлаждение, питание, программный стек
Расчёт кластера: 10–14 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
Монтаж в стойки, коммутация питания и InfiniBand-фабрики, подключение DLC при необходимости
Монтаж и настройка: 7–14 дней
3 этап
5 этап
2 этап
HGX-платформы, коммутаторы Quantum, HCA, кабели, СХД
Поставка компонентов: 45–90 дней
3–5 рабочих дней
Тестирование, сдача, обучение, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас

{ преимущества }
cобираем связку GPU-узлов, сетевой фабрики и СХД в интеграционных точках, а не отдельн
Инфраструктура в связке
Постпродажное сопровождение
обучаем администраторов клиента, даём альтернативу по поколению InfiniBand, 44-ФЗ и 223-ФЗ, пакет документов для закупки
Вендоры и поставщики
GPU: NVIDIA H100/H200 SXM, A100 SXM. HGX-платформы: Supermicro, Gigabyte, ASUS, Quanta, Foxconn. Коммутаторы и HCA: NVIDIA — Quantum/Quantum-2, ConnectX-6/7. Параллельная ФС: Lustre (open), IBM Spectrum Scale, BeeGFS, VAST, WEKA. Планировщики: Slurm (open), Kubernetes + NVIDIA GPU Operator
проектируем питание и охлаждение стойки — не «оборудование придёт, а куда ставить, вы разберётесь»
Питание и охлаждение
Опыт
опыт с Fat-Tree топологиями на 2–128 узлов, включая rail-optimized NCCL и жидкостное охлаждение DLC
Пришлите задачу обучения (модель, размер параметров, датасет), целевое число узлов сейчас и через 12–24 месяца, условия ЦОД (мощность стойки, готовность к DLC) — по итогам обследования и расчёта кластера (15–21 рабочий день) вернёмся с проектом

Пришлите ТЗ — вернёмся с проектом кластера

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Кластер — 2 и более GPU-узлов, соединённых отдельной InfiniBand-фабрикой Fat-Tree. Появляются коммутаторы Quantum, общая СХД с параллельной ФС, планировщик Slurm или Kubernetes, сквозной мониторинг. Один узел работает автономно, кластер живёт как единая распределённая среда обучения.