Заявка на консультацию
Оставьте ваши данные и наши менеджеры свяжуться с вами в ближайшее время
Рейтинг компании
В реестре проверенных поставщиков
В реестре проверенных поставщиков

GPU-кластер для inference (инференса)

GPU-кластер для inference — связка 2–64+ узлов на L40S, A100, H100 или H200 под production-запуск LLM, CV и RAG-моделей в ЦОД клиента, когда данные не выпускаются в облако, а цена вопроса — стоимость одного запроса, а не время обучения
Главная
/
/
/
GPU-кластер для inference
Назад
Высокая нагрузка
Регулярный поток запросов свыше 1 млн в сутки — облачные API становятся дороже CapEx на свою инфраструктуру за 12–18 месяцев
Собственная модель
Кастомная fine-tuned модель — облачные API «нашей» модели не поддерживают, нужен свой сервер
Низкая задержка и строгий SLA
Строгий SLA по latency (P99 < 200 мс) — облачная задержка через интернет и очередь провайдера не подходит
Мультимодельный inference
Мультимодельный сценарий: 10+ моделей одновременно с MIG-шардированием и общим autoscaling — своё дешевле
Данные внутри контура
Данные пользователей не выпускаются в облако (персональные, коммерческая тайна, гостайна) — inference строго в контуре заказчика
Оставьте заявку и получите бесплатную консультацию

Когда нужен свой inference-кластер, а не облако

{ сценарии }

Inference vs обучение: почему другая конфигурация

{ отличия }
Параметр Обучение (GPU-кластер для обучения) Inference (эта страница)
Ключевая метрика Время обучения, NCCL-пропускная Latency P99, throughput req/sec, cost per query
Целевой GPU H100/H200 SXM (HBM + NVLink Switch) L40S (48 ГБ, 350 Вт) — под $/query, A100/H100 для крупных моделей
Форм-фактор узла 8-GPU HGX SXM (высокая плотность) 2×L40S PCIe (2U) или 4×A100/H100 PCIe (4U)
Межузловая сеть InfiniBand NDR 400G (rail-optimized NCCL) 25/100 GbE Ethernet чаще всего, InfiniBand не обязателен
Внутриузловая связь GPU NVLink Switch критичен (all-reduce) PCIe Gen5 хватает, NVLink только под tensor-parallel крупной модели
Хранение Параллельная ФС для датасетов (Lustre/GPFS) Локальный NVMe для кэша модели (2–4 ТБ на узел)
Питание стойки 20–50 кВт (плотные HGX) 5–12 кВт (обычно воздух хватает)
Планировщик Slurm или Kubernetes с device-plugin Kubernetes с NVIDIA GPU Operator и autoscaling обязательно
Программный стек PyTorch DDP, DeepSpeed, Megatron-LM, NCCL vLLM, TensorRT-LLM, NVIDIA Triton, TGI, ONNX Runtime
Multi-tenancy Обычно нет — обучение занимает узел целиком Часто через MIG (H100 — 7 инстансов)
Балансировка нагрузки Не требуется — задача одна Обязательно load balancer + очередь запросов
Сроки поставки 90–150+ рабочих дней 60–100 рабочих дней (проще конфигурация)

Как выбираем GPU под inference-задачу

{ критерии }
GPU HBM/память TDP Форм-фактор На что подходит
NVIDIA L4 (24 ГБ) 24 ГБ GDDR6 72 Вт PCIe HH-LP (низкопрофильный) CV-модели, embedding, лёгкий LLM ≤ 7B, edge-inference
NVIDIA L40S (48 ГБ) 48 ГБ GDDR6 350 Вт PCIe 2-слот Рабочая лошадка inference LLM 7B–13B, диффузия, TTS/STT, RAG-embedding
NVIDIA A100 40 ГБ 40 ГБ HBM2e 300–400 Вт PCIe / SXM LLM 13B–34B, mixed inference с фон-обучением
NVIDIA A100 80 ГБ 80 ГБ HBM2e 300–400 Вт PCIe / SXM LLM 34B–70B (FP16), длинный контекст embedding
NVIDIA H100 80 ГБ 80 ГБ HBM3 350–700 Вт PCIe / SXM LLM 70B, MoE, FP8-inference через TensorRT-LLM
NVIDIA H200 141 ГБ 141 ГБ HBM3e 700 Вт SXM Крупные LLM 70B+ с длинным контекстом (32K+ токенов), RAG с большим окном

Метрики inference: что считаем в проекте

{ расчет }
Метрика Что означает Куда влияет
Latency P50 / P95 / P99 Задержка одного запроса в 50 / 95 / 99% случаев SLA конечного пользователя, выбор batch size, continuous batching
Time-to-first-token (TTFT) Задержка первого токена в LLM-ответе Пользовательское восприятие «отзывчивости» интерфейса
Time-per-output-token (TPOT) Задержка каждого следующего токена в LLM-стриме Пропускная скорость чтения ответа пользователем
Throughput (req/sec) Число обработанных запросов в секунду на узел Число узлов в кластере, autoscaling
GPU utilization % Загрузка GPU по вычислениям Cost per query — простой равен перерасходу
KV-cache footprint Объём HBM под key-value кэш LLM (растёт с длиной контекста) Максимальное число параллельных сессий
Cost per 1M requests Итоговая стоимость 1 миллиона запросов Ключевая экономическая метрика проекта

Как считаем конфигурацию кластера

{ расчет }
Параметр подбора На что влияет Что уточняем у клиента
Размер модели и формат весов GPU и HBM, квантизация (FP16 / FP8 / INT8 / INT4) Параметры модели, поддерживает ли она FP8/INT8-квант
Целевой SLA по latency (P99) Максимальный batch size, требования к TTFT и TPOT SLA пользователя, строгость 100 мс vs 2 сек
Целевой QPS Число inference-узлов, autoscaling-политика Пиковая нагрузка, суточный профиль
Длина контекста LLM (input tokens) KV-cache footprint в HBM, число параллельных сессий Максимальный context window
Multi-tenancy MIG-шардирование, изоляция моделей Число моделей, требования к изоляции
Тип задачи (LLM / CV / embedding / TTS) Inference-framework (vLLM / TensorRT / Triton / TGI) Стек, который уже используется
Data-путь: где хранятся модели Локальный NVMe 2–4 ТБ, CI/CD-загрузка новых версий Частота обновления моделей, объём модели
Условия ЦОД Мощность стойки, тип охлаждения Обычно для inference хватает воздуха
Планы масштабирования Kubernetes-autoscaling, свободные слоты в стойках План роста, пиковые события

Три профиля масштаба inference-кластера

{ конфигурации }
Форм-фактор
2U универсальный
Сеть
2×10/25 GbE Ethernet
Охлаждение
Воздух, стойка 5–8 кВт
Питание
2×2000 Вт N+1
Стартовый inference-кластер: 2–4 узла с 2×L40S PCIe (48 ГБ)
На что рассчитано: inference LLM 7B–13B (Llama-3, Mistral, Qwen), диффузионные модели, embedding для RAG, TTS/STT. Пиковая нагрузка до 100 req/sec
Форм-фактор
4U с 4×A100 PCIe или 5U HGX для 2×H100
Сеть
4×25/100 GbE Ethernet, опционально 2×NDR 400G под tensor-parallel
Охлаждение
Воздух или частично DLC (10–15 кВт)
Питание
Kubernetes с horizontal + vertical autoscaling
Продуктивный inference-кластер: 4–16 узлов с 4×A100 80 ГБ PCIe или 2×H100 SXM
На что рассчитано: продуктивный inference LLM 34B–70B, MoE, RAG с длинным контекстом, мультимодельность 5–10 моделей одновременно. Пиковая нагрузка до 5 000 req/sec
Форм-фактор
HGX-платформы 5–6U
Сеть
HCA ConnectX-7 для узлов на tensor-parallel крупных LLM
Хранение
Распределённая object storage под каталог моделей
Питание
Стойка 20–30 кВт с DLC
Крупный inference-кластер: 16–64+ узлов с 8×H100 SXM HGX или 4×H200 SXM
На что рассчитано: pre-training foundation-моделей 70B–1T параметров, отраслевые LLM, крупные R&D-центры банков и корпораций

Что входит в поставку?

{ комплектация }
Inference-узлы: собранные серверы, локальный NVMe
Сеть: Ethernet 25/100 GbE, опционально InfiniBand NDR
Load balancer перед inference-узлами
Kubernetes-платформа с NVIDIA GPU Operator
Проект питания и охлаждения стойки
Приёмочные тесты
Обучение, постпродажное сопровождение
Пакет документов под 44-ФЗ или 223-ФЗ при госзаказе
Заказать консультацию
какие модели, целевой QPS, SLA по latency, планы роста
Заявка и уточнение: 3–5 дней
выбор GPU (L40S / A100 / H100), число узлов, inference-framework, autoscaling-политика, сеть, СХД
Расчёт кластера: 7–10 дней

Как мы работаем

{ этапы и сроки }
1 этап
по графику клиента
Согласование, договор
Монтаж в стойки, мониторинг, пилотный запуск с референсной моделью
Монтаж и настройка: 3–5 дней
3 этап
5 этап
2 этап
серверы с GPU (L40S — 30–60 дней, H100 — 45–90 дней), сетевое оборудование
Поставка компонентов: 30–90 дней
3–5 рабочих дней
Сдача, обучение, гарантия и постпродажное сопровождение
4 этап
6 этап

Почему выбирают нас

{ преимущества }
считаем конфигурацию по стоимости запроса, а не по «топовым GPU» — выбор L40S / A100 / H100 под конкретный workload
Подбор GPU по стоимости запроса
Работа под ТЗ
работаем под ТЗ и production-workload, 44-ФЗ и 223-ФЗ, пакет документов для закупки
Вендоры и поставщики
GPU: NVIDIA L4/L40S/A100/H100/H200. Серверы: Supermicro, Gigabyte, Dell, HPE, Quanta. CPU: Intel Xeon Sapphire/Emerald Rapids, AMD EPYC Genoa. Сеть: Cisco, Arista, NVIDIA (Ethernet), NVIDIA Quantum-2 (InfiniBand). Inference-серверы: vLLM, NVIDIA Triton, TensorRT-LLM, HuggingFace TGI
отдаём после нагрузочного теста с достижением SLA (P99), а не после включения питани
Ghjdthrf SLA
Inference под ключ
опыт с vLLM, TensorRT-LLM, Triton, TGI — не «сервер поставили и уходим», а работающий inference-сервис
Пришлите модель (или их список), целевой QPS и SLA по latency (P99), длину контекста LLM и планы роста — по итогам обследования и расчёта кластера (10–15 рабочих дней) вернёмся с проектом: выбор GPU (L40S / A100 / H100 / H200), число узлов, inference-framework, Kubernetes-autoscaling с MIG

Пришлите ТЗ — вернёмся с проектом inference-кластера

{ свяжитесь с нами }

Часто задаваемые вопросы

{ FAQ }
L40S 48 ГБ 350 Вт против H100 80 ГБ 700 Вт. Для LLM 7B–13B L40S даёт примерно в 2× меньше $/запрос при сопоставимой latency: дешевле, потребляет вдвое меньше, а KV-cache 48 ГБ хватает под рабочие сессии. H100 оправдан для 70B+ и MoE, где нужен HBM3 и FP8 через TensorRT-LLM.