8 (800) 302-34-73

GPU-кластер для inference (инференса)

GPU-кластер для inference — связка 2–64+ узлов на L40S, A100, H100 или H200 под production-запуск LLM, CV и RAG-моделей в ЦОД клиента, когда данные не выпускаются в облако, а цена вопроса — стоимость одного запроса, а не время обучения

{ сценарии }

Когда нужен свой inference-кластер, а не облако

Высокая нагрузка

Высокая нагрузка

Регулярный поток запросов свыше 1 млн в сутки — облачные API становятся дороже CapEx на свою инфраструктуру за 12–18 месяцев

Данные внутри контура

Данные внутри контура

Данные пользователей не выпускаются в облако (персональные, коммерческая тайна, гостайна) — inference строго в контуре заказчика

Собственная модель

Собственная модель

Кастомная fine-tuned модель — облачные API «нашей» модели не поддерживают, нужен свой сервер

Низкая задержка и строгий SLA

Низкая задержка и строгий SLA

Строгий SLA по latency (P99 < 200 мс) — облачная задержка через интернет и очередь провайдера не подходит

Мультимодельный inference

Мультимодельный inference

Мультимодельный сценарий: 10+ моделей одновременно с MIG-шардированием и общим autoscaling — своё дешевле

{ отличия }

Inference vs обучение: почему другая конфигурация

ПараметрОбучение (GPU-кластер для обучения)Inference (эта страница)
Ключевая метрикаВремя обучения, NCCL-пропускнаяLatency P99, throughput req/sec, cost per query
Целевой GPUH100/H200 SXM (HBM + NVLink Switch)L40S (48 ГБ, 350 Вт) — под $/query, A100/H100 для крупных моделей
Форм-фактор узла8-GPU HGX SXM (высокая плотность)2×L40S PCIe (2U) или 4×A100/H100 PCIe (4U)
Межузловая сетьInfiniBand NDR 400G (rail-optimized NCCL)25/100 GbE Ethernet чаще всего, InfiniBand не обязателен
Внутриузловая связь GPUNVLink Switch критичен (all-reduce)PCIe Gen5 хватает, NVLink только под tensor-parallel крупной модели
ХранениеПараллельная ФС для датасетов (Lustre/GPFS)Локальный NVMe для кэша модели (2–4 ТБ на узел)
Питание стойки20–50 кВт (плотные HGX)5–12 кВт (обычно воздух хватает)
ПланировщикSlurm или Kubernetes с device-pluginKubernetes с NVIDIA GPU Operator и autoscaling обязательно
Программный стекPyTorch DDP, DeepSpeed, Megatron-LM, NCCLvLLM, TensorRT-LLM, NVIDIA Triton, TGI, ONNX Runtime
Multi-tenancyОбычно нет — обучение занимает узел целикомЧасто через MIG (H100 — 7 инстансов)
Балансировка нагрузкиНе требуется — задача однаОбязательно load balancer + очередь запросов
Сроки поставки90–150+ рабочих дней60–100 рабочих дней (проще конфигурация)
{ критерии }

Как выбираем GPU под inference-задачу

GPUHBM/памятьTDPФорм-факторНа что подходит
NVIDIA L4 (24 ГБ)24 ГБ GDDR672 ВтPCIe HH-LP (низкопрофильный)CV-модели, embedding, лёгкий LLM ≤ 7B, edge-inference
NVIDIA L40S (48 ГБ)48 ГБ GDDR6350 ВтPCIe 2-слотРабочая лошадка inference LLM 7B–13B, диффузия, TTS/STT, RAG-embedding
NVIDIA A100 40 ГБ40 ГБ HBM2e300–400 ВтPCIe / SXMLLM 13B–34B, mixed inference с фон-обучением
NVIDIA A100 80 ГБ80 ГБ HBM2e300–400 ВтPCIe / SXMLLM 34B–70B (FP16), длинный контекст embedding
NVIDIA H100 80 ГБ80 ГБ HBM3350–700 ВтPCIe / SXMLLM 70B, MoE, FP8-inference через TensorRT-LLM
NVIDIA H200 141 ГБ141 ГБ HBM3e700 ВтSXMКрупные LLM 70B+ с длинным контекстом (32K+ токенов), RAG с большим окном
{ расчет }

Метрики inference: что считаем в проекте

МетрикаЧто означаетКуда влияет
Latency P50 / P95 / P99Задержка одного запроса в 50 / 95 / 99% случаевSLA конечного пользователя, выбор batch size, continuous batching
Time-to-first-token (TTFT)Задержка первого токена в LLM-ответеПользовательское восприятие «отзывчивости» интерфейса
Time-per-output-token (TPOT)Задержка каждого следующего токена в LLM-стримеПропускная скорость чтения ответа пользователем
Throughput (req/sec)Число обработанных запросов в секунду на узелЧисло узлов в кластере, autoscaling
GPU utilization %Загрузка GPU по вычислениямCost per query — простой равен перерасходу
KV-cache footprintОбъём HBM под key-value кэш LLM (растёт с длиной контекста)Максимальное число параллельных сессий
Cost per 1M requestsИтоговая стоимость 1 миллиона запросовКлючевая экономическая метрика проекта
{ расчет }

Как считаем конфигурацию кластера

Параметр подбораНа что влияетЧто уточняем у клиента
Размер модели и формат весовGPU и HBM, квантизация (FP16 / FP8 / INT8 / INT4)Параметры модели, поддерживает ли она FP8/INT8-квант
Целевой SLA по latency (P99)Максимальный batch size, требования к TTFT и TPOTSLA пользователя, строгость 100 мс vs 2 сек
Целевой QPSЧисло inference-узлов, autoscaling-политикаПиковая нагрузка, суточный профиль
Длина контекста LLM (input tokens)KV-cache footprint в HBM, число параллельных сессийМаксимальный context window
Multi-tenancyMIG-шардирование, изоляция моделейЧисло моделей, требования к изоляции
Тип задачи (LLM / CV / embedding / TTS)Inference-framework (vLLM / TensorRT / Triton / TGI)Стек, который уже используется
Data-путь: где хранятся моделиЛокальный NVMe 2–4 ТБ, CI/CD-загрузка новых версийЧастота обновления моделей, объём модели
Условия ЦОДМощность стойки, тип охлажденияОбычно для inference хватает воздуха
Планы масштабированияKubernetes-autoscaling, свободные слоты в стойкахПлан роста, пиковые события
{ конфигурации }

Три профиля масштаба inference-кластера

Стартовый inference-кластер: 2–4 узла с 2×L40S PCIe (48 ГБ)

На что рассчитано: inference LLM 7B–13B (Llama-3, Mistral, Qwen), диффузионные модели, embedding для RAG, TTS/STT. Пиковая нагрузка до 100 req/sec

Форм-фактор
2U универсальный
Сеть
2×10/25 GbE Ethernet
Охлаждение
Воздух, стойка 5–8 кВт
Питание
2×2000 Вт N+1

Продуктивный inference-кластер: 4–16 узлов с 4×A100 80 ГБ PCIe или 2×H100 SXM

На что рассчитано: продуктивный inference LLM 34B–70B, MoE, RAG с длинным контекстом, мультимодельность 5–10 моделей одновременно. Пиковая нагрузка до 5 000 req/sec

Форм-фактор
4U с 4×A100 PCIe или 5U HGX для 2×H100
Сеть
4×25/100 GbE Ethernet, опционально 2×NDR 400G под tensor-parallel
Охлаждение
Воздух или частично DLC (10–15 кВт)
Питание
Kubernetes с horizontal + vertical autoscaling

Крупный inference-кластер: 16–64+ узлов с 8×H100 SXM HGX или 4×H200 SXM

На что рассчитано: pre-training foundation-моделей 70B–1T параметров, отраслевые LLM, крупные R&D-центры банков и корпораций

Форм-фактор
HGX-платформы 5–6U
Сеть
HCA ConnectX-7 для узлов на tensor-parallel крупных LLM
Хранение
Распределённая object storage под каталог моделей
Питание
Стойка 20–30 кВт с DLC
{ комплектация }

Что входит в поставку?

Inference-узлы: собранные серверы, локальный NVMe
Сеть: Ethernet 25/100 GbE, опционально InfiniBand NDR
Load balancer перед inference-узлами
Kubernetes-платформа с NVIDIA GPU Operator
Проект питания и охлаждения стойки
Приёмочные тесты
Обучение, постпродажное сопровождение
Пакет документов под 44-ФЗ или 223-ФЗ при госзаказе
{ этапы и сроки }

Как мы работаем

  1. 1 этап

    Заявка и уточнение: 3–5 дней

    какие модели, целевой QPS, SLA по latency, планы роста

  2. 2 этап

    Расчёт кластера: 7–10 дней

    выбор GPU (L40S / A100 / H100), число узлов, inference-framework, autoscaling-политика, сеть, СХД

  3. 3 этап

    Согласование, договор

    по графику клиента

  4. 4 этап

    Поставка компонентов: 30–90 дней

    серверы с GPU (L40S — 30–60 дней, H100 — 45–90 дней), сетевое оборудование

  5. 5 этап

    Монтаж и настройка: 3–5 дней

    Монтаж в стойки, мониторинг, пилотный запуск с референсной моделью

  6. 6 этап

    Сдача, обучение, гарантия и постпродажное сопровождение

    3–5 рабочих дней

{ преимущества }

Почему выбирают нас

Подбор GPU по стоимости запроса

считаем конфигурацию по стоимости запроса, а не по «топовым GPU» — выбор L40S / A100 / H100 под конкретный workload

Inference под ключ

опыт с vLLM, TensorRT-LLM, Triton, TGI — не «сервер поставили и уходим», а работающий inference-сервис

Ghjdthrf SLA

отдаём после нагрузочного теста с достижением SLA (P99), а не после включения питани

Вендоры и поставщики

GPU: NVIDIA L4/L40S/A100/H100/H200. Серверы: Supermicro, Gigabyte, Dell, HPE, Quanta. CPU: Intel Xeon Sapphire/Emerald Rapids, AMD EPYC Genoa. Сеть: Cisco, Arista, NVIDIA (Ethernet), NVIDIA Quantum-2 (InfiniBand). Inference-серверы: vLLM, NVIDIA Triton, TensorRT-LLM, HuggingFace TGI

Работа под ТЗ

работаем под ТЗ и production-workload, 44-ФЗ и 223-ФЗ, пакет документов для закупки

{ свяжитесь с нами }

Пришлите ТЗ — вернёмся с проектом inference-кластера

Пришлите модель (или их список), целевой QPS и SLA по latency (P99), длину контекста LLM и планы роста — по итогам обследования и расчёта кластера (10–15 рабочих дней) вернёмся с проектом: выбор GPU (L40S / A100 / H100 / H200), число узлов, inference-framework, Kubernetes-autoscaling с MIG

{ FAQ }

Часто задаваемые вопросы

L40S 48 ГБ 350 Вт против H100 80 ГБ 700 Вт. Для LLM 7B–13B L40S даёт примерно в 2× меньше $/запрос при сопоставимой latency: дешевле, потребляет вдвое меньше, а KV-cache 48 ГБ хватает под рабочие сессии. H100 оправдан для 70B+ и MoE, где нужен HBM3 и FP8 через TensorRT-LLM.

Примерно в 2× throughput против FP16 без заметной потери качества для большинства LLM inference. Работает на H100/H200 (Transformer Engine поддерживает FP8 нативно). Требует конвертации модели под TensorRT-LLM — часть пусконаладки на нашей стороне.

Через пилот на референсной модели. Пример: если один узел L40S тянет 30 req/sec на LLM-13B при P99 менее 500 мс, то на 3 000 req/sec надо 100 узлов + запас на пик 20–30%. Точная цифра получается после нагрузочного теста — зависит от длины контекста, batch policy и квантизации.

Multi-Instance GPU шардирует одну H100 на 7 виртуальных GPU с изолированной памятью. Нужен при мультимодельности (5–10 моделей одновременно) и изоляции команд-tenants. Одна физическая H100 обслуживает 7 моделей параллельно.

Нет. Для standalone-inference хватает 25/100 GbE — межузловой трафик минимален (load balancer раскидывает запросы, модель отвечает локально). InfiniBand нужен только при tensor-parallel крупной модели (Llama-3-405B, MoE), там NCCL между узлами становится узким местом.

60–100 рабочих дней от заявки до сдачи в зависимости от масштаба и модели GPU. L40S — 30–60 дней поставки, H100 — 45–90. Плюс настройка Kubernetes с inference-сервером, пилот и нагрузочный тест до достижения SLA.

{ свяжитесь с нами }

Остались вопросы? Оставьте заявку и мы свяжемся с вами
в ближайшее время

Заполните форму, и мы проведём бесплатный аудит: проверим серверы, сети и системы безопасности, определим риски и предложим план перехода на отечественное оборудование.