Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

GPU-серверы NVIDIA H100/H200 для обучения ИИ-моделей

Сервер H100 или H200 под обучение ИИ-моделей у себя — задача команд, уходящих от облачных GPU или добавляющих свои мощности. Собираем узел под конкретный workload: 4 или 8 GPU H100/H200 SXM с NVLink Switch, 1–2 ТБ DDR5, NVMe-кэш под датасеты, ConnectX-7 под кластерную обвязку, питание стойки 8–14 кВт с воздухом или до 30–50 кВт с жидкостным DLC, готовый программный стек CUDA 12.x, cuDNN, NCCL и TensorRT-LLM. Собираем, прошиваем и отдаём после приёмочных NCCL-бенчмарков и референсного прогона обучения на вашей модели. Рядом — форма заявки
Назад
Fine-tuning LLM
Fine-tuning корпоративных LLM (7B–70B) на внутренних данных, которые нельзя выносить в облако
Экономика против облака
R&D-команда с постоянной нагрузкой: облачные счета уже превышают CapEx на собственный узел за 12–18 месяцев
Защищённый контур
Требования по данным (персональные данные, гостайна, коммерческая тайна) — обучение только в собственном контуре
Масштабирование в кластер
Первый узел под масштабирование в кластер, далее к нему подключается сетевая фабрика InfiniBand для GPU-кластера с ещё N узлов
Pre-training моделей
Pre-training крупных foundation-моделей — при непрерывной загрузке окупаемость собственной инфраструктуры выше облачной
Оставьте заявку и получите бесплатную консультацию

Когда бизнесу нужен свой сервер H100 или H200

{ серверы }

H100 vs H200: как выбирают модель под задачу

{ отличия }
Параметр H100 SXM5 80 ГБ H100 PCIe 80 ГБ H200 SXM5 141 ГБ
Тип памяти HBM3 HBM3 HBM3e
Объём памяти 80 ГБ 80 ГБ 141 ГБ
Пропускная память 3,35 ТБ/с 2 ТБ/с 4,8 ТБ/с
TDP 700 Вт 350 Вт 700 Вт
NVLink Gen4 900 ГБ/с (HGX-платформа, 8 GPU) 600 ГБ/с попарно (мост) 900 ГБ/с (HGX, 8 GPU)
FP8 Transformer Engine Да Да Да
MIG (шардирование GPU) До 7 инстансов До 7 инстансов До 7 инстансов
Оптимальная задача Fine-tuning 7B–70B, обучение CV, mixed Одиночные узлы, инференс, малые команды Pre-training 70B+, LLM с длинным контекстом, RAG-инференс
Форм-фактор системы 8-GPU HGX (5U–6U), 4-GPU (4U) PCIe 4U с 4–8 картами через bridge 8-GPU HGX (5U–6U)

PCIe vs SXM: форм-фактор системы

{ критерии }
Параметр 4×H100 PCIe 8×H100 SXM HGX 8×H200 SXM HGX
Форм-фактор 4U универсальный 5U–6U специализированный 5U–6U специализированный
Связь между GPU PCIe Gen5 x16 (128 ГБ/с) + опц. NVLink bridge попарно NVLink Switch Gen4 (900 ГБ/с между любыми парами) NVLink Switch Gen4 (900 ГБ/с)
Всего памяти в узле 320 ГБ HBM3 640 ГБ HBM3 1128 ГБ HBM3e
Питание узла 3–4 кВт 10–12 кВт 10–12 кВт
Охлаждение Воздух Воздух или жидкость Воздух или жидкость
Когда выбирают R&D, инференс, малые команды, отдельные проекты Продуктивное обучение с высокой межGPU-нагрузкой (NCCL all-reduce) Обучение крупных моделей с длинным контекстом

Готовые конфигурации под задачу

{ конфигурации }
Форм-фактор
4U универсальный
CPU
2×Xeon Sapphire Rapids или EPYC Genoa
RAM
1 ТБ DDR5 ECC
NVMe
2×NVMe U.2 3,84 ТБ под датасет-кэш
Стартовый узел для fine-tuning: 4×H100 PCIe 80 ГБ
На что рассчитано: fine-tuning LLM 7B–13B с LoRA/QLoRA, обучение CV, R&D-команда до 5 человек, тестовая ML-платформа
Форм-фактор
5U–6U HGX-платформа H100
CPU
2×EPYC Genoa или Xeon Emerald Rapids под PCIe Gen5
RAM
2 ТБ DDR5 ECC
NVMe
8×NVMe U.2 7,68 ТБ (гибридный кэш и tier)
Продуктивный узел обучения: 8×H100 SXM HGX 640 ГБ
На что рассчитано: full fine-tuning LLM 30B–70B, обучение foundation-моделей до 70B, продуктивная ML-платформа с 10+ инженерами, первый узел кластера с готовностью к расширению до 8–16 узлов
Форм-фактор
5U–6U HGX-платформа H200
CPU
2×EPYC Genoa
RAM
2 ТБ DDR5 ECC
NVMe
Массив 30+ ТБ под длинные датасеты
Узел под крупные LLM: 8×H200 SXM HGX 1128 ГБ HBM3e
На что рассчитано: pre-training крупных LLM с длинным контекстом (Llama-70B+, MoE-модели, RAG-инференс), где 80 ГБ HBM3 требует шардирования между узлами, а 141 ГБ HBM3e даёт весь workload внутри одного узла

Охлаждение и питание стойки под GPU-серверы

{ подготовка стойки }
Сценарий Мощность стойки Охлаждение Комментарий
1 узел 4×H100 PCIe 5–7 кВт Воздух через фронт стойки Работает в типовом ЦОД с прецизионным кондиционером
1 узел 8×H100 SXM HGX 10–12 кВт Воздух с горячим коридором + сплит-ряд Верхний предел воздушного охлаждения
2 узла 8×H100 SXM в одной стойке 20–24 кВт Жидкостное DLC обязательно Воздух не тянет, нужен CDU и подготовка стойки
Стойка 4×H100 SXM (4 узла) 40–48 кВт DLC с закрытым контуром ЦОД должен иметь холодный контур, чиллер или free-cooling
Стойка H200 плотная сборка 30–50 кВт DLC + резерв по чиллеру Требует проекта под ключ

Что входит в поставку?

{ комплектация }
Сетевые адаптеры, БП с резервированием
HGX-платформа с NVLink Switch или PCIe-шасси
Установленная ОС, CUDA 12.x, cuDNN, NCCL, драйверы NVIDIA
Готовый образ под запрос
Расчёт PDU, схема подключения, резервирование
Проектирование охлаждения: воздух или жидкость
Кабельная инфраструктура: питание, сетевая обвязка
Обучение, мониторинг, разбор инцидентов, консультации
Заказать консультацию
задача обучения, размер модели, условия ЦОД, планы роста
Заявка и обследование: 3–5 дней
H100 vs H200, PCIe vs SXM, число GPU, CPU, RAM, NVMe, охлаждение, питание
Расчёт конфигурации, спецификация: 7–10 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
сборка узла, прошивка, установка ОС и стека CUDA/NCCL, конфигурация под workload, подключение к питанию и сети
Сборка и монтаж, настройка: 5–10 дней
3 этап
5 этап
2 этап
специфичное оборудование, H200 — до 90 дней
Поставка компонентов и HGX-платформы: 40–70 дней
2–3 рабочих дня
Сдача, обучение персонала, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас?

{ под ключ }
собираем и настраиваем узел под задачу обучения, а не отдаём голую железку с драйвером
Настройка узла под обучение
Постпродажное сопровождение
помогаем администратору кластера с обновлениями драйверов CUDA, прошивок BMC и добавлением новых узлов по мере роста
Вендоры и поставщики
GPU: NVIDIA H100 SXM/PCIe, H200 SXM. HGX-платформы: Supermicro, Gigabyte, ASUS, Quanta, Foxconn. CPU: Intel Xeon Sapphire/Emerald Rapids, AMD EPYC Genoa/Bergamo. Память DDR5 ECC: Samsung, Micron, SK Hynix. NVMe: Samsung, Micron, Kioxia. Сетевые адаптеры: NVIDIA ConnectX-6/7
отдаём после приёмочных NCCL-бенчмарков и референсного прогона обучения, а не после включения питания
Проверка под нагрузкой
Опыт
опыт с HGX-платформами H100 и H200, включая жидкостное охлаждение DLC
Пришлите задачу обучения (модель, размер, датасет), условия ЦОД и планы роста — по итогам заявки и расчёта (8–12 рабочих дней) вернёмся с конфигурацией узла и планом питания и охлаждения стойки. Приёмочные NCCL-тесты и точный срок поставки после согласования и заказа HGX-платформы (для H100 — 60–90 рабочих дней от заявки до сдачи, для H200 — до 110). Пакет документов под 44-ФЗ при госзаказе

Пришлите ТЗ — вернёмся с конфигурацией и планом монтажа

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Llama-70B в FP16 требует ~140 ГБ на веса. В H100 (80 ГБ) модель не помещается на один GPU и требует model-parallel + ZeRO-3 с накладными расходами на межGPU-обмен. В H200 (141 ГБ) веса помещаются на один GPU, обучение идёт без шардирования и быстрее по wall-clock. Для 30B–65B разница нивелируется.