Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

Инфраструктура для обучения ИИ-моделей: серверы, сеть и СХД под ключ

Инфраструктура для обучения ИИ-моделей — не одна коробка, а три уровня в связке: GPU-узлы H100/H200 с HBM и NVLink Switch, сетевая фабрика InfiniBand HDR 200 или NDR 400 с латентностью около 100 нс и GPUDirect RDMA, СХД под датасеты с параллельной ФС и локальным NVMe-кэшем в каждом узле
Главная
/
/
/
Инфраструктура для обучения ИИ-моделей
Назад
Выход из облака
компания выходит из облака (Yandex Cloud, VK Cloud, Selectel) на свою инфраструктуру — облачные счета уже превысили CapEx за 12–18 месяцев
Расширение GPU-кластера
расширяется существующий R&D-парк GPU-серверов до кластера с общей сетью и хранением
Закрытый контур
требования по данным (персональные, гостайна, коммерческая тайна) — обучение только в собственном ЦОД
Постоянная ML-нагрузка
отраслевая ML-платформа (банк, ритейл, промышленность) с постоянной нагрузкой и понятным горизонтом окупаемости
ML-платформа с нуля
строится новая внутренняя ML-платформа с нуля — 4–32 узла GPU, сеть, СХД, планировщик
Оставьте заявку и получите бесплатную консультацию

Когда нужна ML-инфраструктура под ключ, а не отдельные железки

{ сценарии }

Три уровня инфраструктуры и что делает каждый

{ отличия }
Уровень Что решает Ключевые компоненты Что ломает обучение при недостатке
Compute — GPU-узлы Считает градиенты, обновляет веса H100/H200 SXM в HGX 8-GPU, NVLink Switch внутри узла, DDR5 ECC, PCIe Gen5, локальный NVMe Не хватает HBM → шардирование модели, слабый CPU → GPU голодает по данным
Network — сетевая фабрика Связывает узлы для распределённого обучения (NCCL all-reduce) HCA ConnectX-7, коммутаторы Quantum-2 QM9700, Fat-Tree, GPUDirect RDMA, MTU 4KB Ethernet вместо InfiniBand → NCCL медленный → 30–50% времени обучения теряется
Storage — СХД под датасеты Держит датасеты, чекпоинты, эмбеддинги All-flash NVMe параллельная СХД (2–5 ГБ/с sustained на узел), холодный ярус S3, локальный NVMe-кэш в узле Медленный I/O → GPU простаивают в ожидании batch, нет чекпоинт-политики → потеря 100+ часов обучения
Инженерка (транспарентно) Питает и охлаждает PDU 32/63 А, три фазы, воздух до 12 кВт стойки или DLC до 50 кВт Стойка не тянет мощность → плотность падает, ЦОД перегревается

Как считаем комплекс под задачу

{ критерии }
Параметр подбора На что влияет Что уточняем у клиента
Задача обучения (fine-tuning / pre-training / inference) Тип GPU (H100 vs H200), число узлов, класс СХД, интенсивность I/O Стек обучения, размер модели, размер датасета
Размер модели и датасета HBM в узле (80 vs 141 ГБ), объём СХД (10 ТБ vs 1 ПБ), тип ФС Целевые параметры, объём токенизированного корпуса
Число узлов сейчас и через 12–24 мес Топология фабрики (Fat-Tree 1:1 vs 2:1), число коммутаторов, объём СХД План роста
Интенсивность I/O (dataloader) Полоса СХД (2–5 ГБ/с на узел), размер локального NVMe-кэша Отношение вычисление/I/O, batch size, форматы данных (JPEG, TFRecord, parquet)
Условия ЦОД Тип охлаждения (воздух vs DLC), мощность на стойку, длины трасс Мощность стойки, готовность к DLC, план расширения
Планировщик задач Slurm vs Kubernetes с device-plugin, интеграция с MLOps Что уже используется
Отказоустойчивость обучения Checkpoint-политика на СХД, зеркалирование весов Стоимость потерянного часа обучения
Импортозамещение и 44-ФЗ Compute-платформа, СХД, сеть по уровням Тип заказчика

Три профиля масштаба

{ конфигурации }
Сеть
1–2 коммутатора Quantum-2 QM9700 (Fat-Tree non-blocking) под будущий рост
Хранение
1 all-flash NVMe-сервер 100–200 ТБ с параллельной ФС (BeeGFS или Lustre), 2 ГБ/с sustained на узел
Инженерка
2–3 стойки по 12 кВт, воздушное охлаждение
ПО
Slurm с device-plugin
Стартовая ML-платформа для R&D-команды: 2–4 узла с 8×H100 SXM HGX
На что рассчитано: R&D-команда 5–15 инженеров, fine-tuning LLM 7B–70B, эксперименты с CV, накопление датасетов
Сеть
Двухуровневая Fat-Tree на Quantum-2 QM9700, non-blocking 1:1, UFM для мониторинга
Хранение
All-flash параллельная система 500 ТБ–2 ПБ, 5 ГБ/с sustained на узел
Инженерка
4–8 стоек, комбинация воздух (12 кВт) и DLC (20–30 кВт)
ПО
Kubernetes с NVIDIA device-plugin и GPU Operator
Продуктивная ML-платформа: 8–32 узла с 8×H100 SXM HGX
На что рассчитано: ML-платформа с 30+ инженерами, pre-training крупных моделей, гибрид обучение + инференс
Сеть
Полная Fat-Tree на Quantum-2, NVIDIA UFM, rail-optimized routing
Хранение
Enterprise-класс параллельная ФС с ярусами hot/warm/cold, 10+ ГБ/с sustained на узел
Инженерка
Плотная DLC-сборка стоек 30–50 кВт, отдельный холодный контур с чиллером или free-cooling
ПО
Kubernetes + Slurm hybrid, MLOps (MLflow, W&B)
Крупная ML-фабрика: 32–128 узлов с 8×H100/H200 SXM HGX
На что рассчитано: pre-training foundation-моделей 70B–1T параметров, отраслевые LLM, крупные R&D-центры банков и корпораций

Как интегрируются уровни: чему учат провалы

{ интеграция }
GPUDirect Storage
GPUDirect Storage: если СХД поддерживает NVIDIA GDS, датасет идёт напрямую с СХД в HBM GPU минуя CPU. +20–40% по dataloader-производительности. Закладываем в проект СХД, а не «докупим потом»
Checkpoint-производительность
Мониторинг сквозной — не отдельно GPU и СХД: единый Prometheus + DCGM Exporter + IO-экспортеры, чтобы видеть, где именно затык
Локальный NVMe в узле как кэш параллельной ФС — обязателен для батчей эпох обучения, без него параллельная ФС «горит» под тысячами small reads
Локальный NVMe-кэш
Rail-optimized обвязка — каждый GPU в узле идёт в «свой» leaf-коммутатор, снижая контенцию NCCL
Rail-optimized обвязка
Обучение персонала: если внутренние инженеры не знают, чем nvidia-smi topo -m отличается от nvidia-smi, кластер не заработает
Обучение команды
Оставьте заявку и мы свяжемся с вами в ближайшее время

Что входит в поставку?

{ комплектация }
GPU-узлы (собранные и прошитые)
Коммутаторы и кабели
СХД под датасеты, объектное хранилище для холодного яруса
Локальный NVMe-кэш в каждом узле
Питание стойки: проект схема резервирования, расчёт мощности
Охлаждение стойки: воздух или DLC
Программный стек, MLOps-интеграция, тестирование
Обучение инженеров, постпродажное сопровождение
Заказать консультацию
задача обучения, размер моделей, объём датасетов, условия ЦОД, планы роста
Заявка и обследование: 3–5 дней
конфигурация compute, топология сети, объём и класс СХД, ярусы хранения, питание, охлаждение
Расчёт комплекса: 7–10 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
Монтаж в стойки, коммутация питания и сети, подключение DLC при необходимости
Монтаж, настройка: 10–15 дней
3 этап
5 этап
2 этап
GPU-узлы + HGX-платформы, коммутаторы Quantum-2, HCA ConnectX-7, СХ
Поставка оборудования: 50–90 дней
3–5 рабочих дня
Приёмочные тесты, сдача, обучение, документация, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас?

{ под ключ }
собираем комплекс из трёх уровней в связке, а не «сервера отдельно, сеть отдельно, СХД отдельно»
Комплекс из серверов, сети и СХД
Постпродажное сопровождение
помогаем DevOps-инженерам с MLOps-стеком, обновлениями драйверов и расширением compute-парка
Вендоры и поставщики
Работаем под ТЗ, а не по прайсу «в наличии». Честно раскладываем импортозамещение по уровням. Compute (H100/H200) и сеть InfiniBand фактически NVIDIA-only, замещённой альтернативы в реестре Минпромторга нет. Compute-платформа может быть на российской (YADRO, KRAFTWAY) при совместимости с HGX
проектируем питание и охлаждение стойки — не «оборудование придёт, а куда ставить, вы разберётесь»
Инфраструктура
Опыт
опыт с HGX-платформами H100/H200, InfiniBand-фабриками Fat-Tree на 4–128 узлов, параллельными ФС (Lustre, GPFS, BeeGFS)
Пришлите задачу обучения (модели, размеры), объём датасетов, число узлов и условия ЦОД — по итогам заявки и расчёта (15–22 рабочих дня) вернёмся с проектом трёх уровней: конфигурация compute, топология сети Fat-Tree, объём и класс СХД, схема стоек с расчётом питания и охлаждения. План монтажа и сквозные приёмочные тесты (NCCL + dataloader + пилотное обучение) — после поставки оборудования, с фиксированным сроком сдачи. Для госзаказа пакет под 44-ФЗ и 223-ФЗ

Пришлите ТЗ — вернёмся с проектом трёх уровней

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
Тем, что все три уровня сходятся в интеграционных точках — GPUDirect RDMA и Storage, NCCL rail-optimized, checkpoint-политика, сквозной мониторинг. Поштучная закупка не гарантирует, что кластер заработает: сервера приедут, коммутатор через полтора месяца, СХД через два, а собирать вместе будет некому.