8 (800) 302-34-73

GPU-серверы NVIDIA H100/H200 для обучения ИИ-моделей

Сервер H100 или H200 под обучение ИИ-моделей у себя — задача команд, уходящих от облачных GPU или добавляющих свои мощности. Собираем узел под конкретный workload: 4 или 8 GPU H100/H200 SXM с NVLink Switch, 1–2 ТБ DDR5, NVMe-кэш под датасеты, ConnectX-7 под кластерную обвязку, питание стойки 8–14 кВт с воздухом или до 30–50 кВт с жидкостным DLC, готовый программный стек CUDA 12.x, cuDNN, NCCL и TensorRT-LLM. Собираем, прошиваем и отдаём после приёмочных NCCL-бенчмарков и референсного прогона обучения на вашей модели

{ серверы }

Когда бизнесу нужен свой сервер H100 или H200

Fine-tuning LLM

Fine-tuning LLM

Fine-tuning корпоративных LLM (7B–70B) на внутренних данных, которые нельзя выносить в облако

Pre-training моделей

Pre-training моделей

Pre-training крупных foundation-моделей — при непрерывной загрузке окупаемость собственной инфраструктуры выше облачной

Экономика против облака

Экономика против облака

R&D-команда с постоянной нагрузкой: облачные счета уже превышают CapEx на собственный узел за 12–18 месяцев

Защищённый контур

Защищённый контур

Требования по данным (персональные данные, гостайна, коммерческая тайна) — обучение только в собственном контуре

Масштабирование в кластер

Масштабирование в кластер

Первый узел под масштабирование в кластер, далее к нему подключается сетевая фабрика InfiniBand для GPU-кластера с ещё N узлов

{ отличия }

H100 vs H200: как выбирают модель под задачу

ПараметрH100 SXM5 80 ГБH100 PCIe 80 ГБH200 SXM5 141 ГБ
Тип памятиHBM3HBM3HBM3e
Объём памяти80 ГБ80 ГБ141 ГБ
Пропускная память3,35 ТБ/с2 ТБ/с4,8 ТБ/с
TDP700 Вт350 Вт700 Вт
NVLink Gen4900 ГБ/с (HGX-платформа, 8 GPU)600 ГБ/с попарно (мост)900 ГБ/с (HGX, 8 GPU)
FP8 Transformer EngineДаДаДа
MIG (шардирование GPU)До 7 инстансовДо 7 инстансовДо 7 инстансов
Оптимальная задачаFine-tuning 7B–70B, обучение CV, mixedОдиночные узлы, инференс, малые командыPre-training 70B+, LLM с длинным контекстом, RAG-инференс
Форм-фактор системы8-GPU HGX (5U–6U), 4-GPU (4U)PCIe 4U с 4–8 картами через bridge8-GPU HGX (5U–6U)
{ критерии }

PCIe vs SXM: форм-фактор системы

Параметр4×H100 PCIe8×H100 SXM HGX8×H200 SXM HGX
Форм-фактор4U универсальный5U–6U специализированный5U–6U специализированный
Связь между GPUPCIe Gen5 x16 (128 ГБ/с) + опц. NVLink bridge попарноNVLink Switch Gen4 (900 ГБ/с между любыми парами)NVLink Switch Gen4 (900 ГБ/с)
Всего памяти в узле320 ГБ HBM3640 ГБ HBM31128 ГБ HBM3e
Питание узла3–4 кВт10–12 кВт10–12 кВт
ОхлаждениеВоздухВоздух или жидкостьВоздух или жидкость
Когда выбираютR&D, инференс, малые команды, отдельные проектыПродуктивное обучение с высокой межGPU-нагрузкой (NCCL all-reduce)Обучение крупных моделей с длинным контекстом
{ конфигурации }

Готовые конфигурации под задачу

Стартовый узел для fine-tuning: 4×H100 PCIe 80 ГБ

На что рассчитано: fine-tuning LLM 7B–13B с LoRA/QLoRA, обучение CV, R&D-команда до 5 человек, тестовая ML-платформа

Форм-фактор
4U универсальный
CPU
2×Xeon Sapphire Rapids или EPYC Genoa
RAM
1 ТБ DDR5 ECC
NVMe
2×NVMe U.2 3,84 ТБ под датасет-кэш

Продуктивный узел обучения: 8×H100 SXM HGX 640 ГБ

На что рассчитано: full fine-tuning LLM 30B–70B, обучение foundation-моделей до 70B, продуктивная ML-платформа с 10+ инженерами, первый узел кластера с готовностью к расширению до 8–16 узлов

Форм-фактор
5U–6U HGX-платформа H100
CPU
2×EPYC Genoa или Xeon Emerald Rapids под PCIe Gen5
RAM
2 ТБ DDR5 ECC
NVMe
8×NVMe U.2 7,68 ТБ (гибридный кэш и tier)

Узел под крупные LLM: 8×H200 SXM HGX 1128 ГБ HBM3e

На что рассчитано: pre-training крупных LLM с длинным контекстом (Llama-70B+, MoE-модели, RAG-инференс), где 80 ГБ HBM3 требует шардирования между узлами, а 141 ГБ HBM3e даёт весь workload внутри одного узла

Форм-фактор
5U–6U HGX-платформа H200
CPU
2×EPYC Genoa
RAM
2 ТБ DDR5 ECC
NVMe
Массив 30+ ТБ под длинные датасеты
{ подготовка стойки }

Охлаждение и питание стойки под GPU-серверы

СценарийМощность стойкиОхлаждениеКомментарий
1 узел 4×H100 PCIe5–7 кВтВоздух через фронт стойкиРаботает в типовом ЦОД с прецизионным кондиционером
1 узел 8×H100 SXM HGX10–12 кВтВоздух с горячим коридором + сплит-рядВерхний предел воздушного охлаждения
2 узла 8×H100 SXM в одной стойке20–24 кВтЖидкостное DLC обязательноВоздух не тянет, нужен CDU и подготовка стойки
Стойка 4×H100 SXM (4 узла)40–48 кВтDLC с закрытым контуромЦОД должен иметь холодный контур, чиллер или free-cooling
Стойка H200 плотная сборка30–50 кВтDLC + резерв по чиллеруТребует проекта под ключ
{ комплектация }

Что входит в поставку?

Сетевые адаптеры, БП с резервированием
HGX-платформа с NVLink Switch или PCIe-шасси
Установленная ОС, CUDA 12.x, cuDNN, NCCL, драйверы NVIDIA
Готовый образ под запрос
Расчёт PDU, схема подключения, резервирование
Проектирование охлаждения: воздух или жидкость
Кабельная инфраструктура: питание, сетевая обвязка
Обучение, мониторинг, разбор инцидентов, консультации
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Заявка и обследование: 3–5 дней

    задача обучения, размер модели, условия ЦОД, планы роста

  2. 2 этап

    Расчёт конфигурации, спецификация: 7–10 дней

    H100 vs H200, PCIe vs SXM, число GPU, CPU, RAM, NVMe, охлаждение, питание

  3. 3 этап

    Согласование, договор

    по графику клиента

  4. 4 этап

    Поставка компонентов и HGX-платформы: 40–70 дней

    специфичное оборудование, H200 — до 90 дней

  5. 5 этап

    Сборка и монтаж, настройка: 5–10 дней

    сборка узла, прошивка, установка ОС и стека CUDA/NCCL, конфигурация под workload, подключение к питанию и сети

  6. 6 этап

    Сдача, обучение персонала, гарантия и постпродажное сопровождение

    2–3 рабочих дня

{ под ключ }

Почему выбирают нас?

Настройка узла под обучение

собираем и настраиваем узел под задачу обучения, а не отдаём голую железку с драйвером

Опыт

опыт с HGX-платформами H100 и H200, включая жидкостное охлаждение DLC

Проверка под нагрузкой

отдаём после приёмочных NCCL-бенчмарков и референсного прогона обучения, а не после включения питания

Вендоры и поставщики

GPU: NVIDIA H100 SXM/PCIe, H200 SXM. HGX-платформы: Supermicro, Gigabyte, ASUS, Quanta, Foxconn. CPU: Intel Xeon Sapphire/Emerald Rapids, AMD EPYC Genoa/Bergamo. Память DDR5 ECC: Samsung, Micron, SK Hynix. NVMe: Samsung, Micron, Kioxia. Сетевые адаптеры: NVIDIA ConnectX-6/7

Постпродажное сопровождение

помогаем администратору кластера с обновлениями драйверов CUDA, прошивок BMC и добавлением новых узлов по мере роста

{ свяжитесь с нами }

Пришлите ТЗ — вернёмся с конфигурацией и планом монтажа

Пришлите задачу обучения (модель, размер, датасет), условия ЦОД и планы роста — по итогам заявки и расчёта (8–12 рабочих дней) вернёмся с конфигурацией узла и планом питания и охлаждения стойки. Приёмочные NCCL-тесты и точный срок поставки после согласования и заказа HGX-платформы (для H100 — 60–90 рабочих дней от заявки до сдачи, для H200 — до 110). Пакет документов под 44-ФЗ при госзаказе

{ FAQ }

Часто задаваемые вопросы

Llama-70B в FP16 требует ~140 ГБ на веса. В H100 (80 ГБ) модель не помещается на один GPU и требует model-parallel + ZeRO-3 с накладными расходами на межGPU-обмен. В H200 (141 ГБ) веса помещаются на один GPU, обучение идёт без шардирования и быстрее по wall-clock. Для 30B–65B разница нивелируется.

Всё решает NCCL all-reduce. В SXM/HGX — NVLink Switch с 900 ГБ/с между парами. Через PCIe Gen5 x16 — около 128 ГБ/с, на порядок медленнее. Для обучения LLM с частой синхронизацией градиентов оправдан SXM, для fine-tuning LoRA и одиночного инференса — PCIe.

2 × 11 кВт ≈ 22 кВт на стойку. Воздушное охлаждение с горячим коридором уже не тянет: закладываем жидкостное DLC либо разносим узлы по разным стойкам. При плотности 40+ кВт (4 узла) DLC — единственный рабочий вариант, ЦОД должен иметь холодный контур и чиллер.

Да, если сразу поставить ConnectX-7 NDR 400G. При добавлении новых узлов подключаем их к InfiniBand-фабрике на Quantum-2 QM9700, настраиваем rail-optimized routing и NCCL — распределённое обучение без пересборки первого узла.

Работаем по 44-ФЗ и 223-ФЗ в части поставки. GPU H100/H200 фактически NVIDIA-only, полностью замещённой альтернативы под обучение LLM в реестре Минпромторга нет. Compute-платформа может быть на российской при совместимости с HGX. CUDA, cuDNN, NCCL тоже NVIDIA-only.

Базовое правило: собственный 8×H100 SXM окупается против облака при непрерывной загрузке 60%+ за 12–18 месяцев (CapEx + питание + место в ЦОД vs почасовой прайс облака). R&D с рваной нагрузкой — облако дешевле, продуктивная ML-платформа с постоянной загрузкой — свой узел.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.