| Параметр | Обучение (GPU-кластер для обучения) | Inference (эта страница) |
|---|---|---|
| Ключевая метрика | Время обучения, NCCL-пропускная | Latency P99, throughput req/sec, cost per query |
| Целевой GPU | H100/H200 SXM (HBM + NVLink Switch) | L40S (48 ГБ, 350 Вт) — под $/query, A100/H100 для крупных моделей |
| Форм-фактор узла | 8-GPU HGX SXM (высокая плотность) | 2×L40S PCIe (2U) или 4×A100/H100 PCIe (4U) |
| Межузловая сеть | InfiniBand NDR 400G (rail-optimized NCCL) | 25/100 GbE Ethernet чаще всего, InfiniBand не обязателен |
| Внутриузловая связь GPU | NVLink Switch критичен (all-reduce) | PCIe Gen5 хватает, NVLink только под tensor-parallel крупной модели |
| Хранение | Параллельная ФС для датасетов (Lustre/GPFS) | Локальный NVMe для кэша модели (2–4 ТБ на узел) |
| Питание стойки | 20–50 кВт (плотные HGX) | 5–12 кВт (обычно воздух хватает) |
| Планировщик | Slurm или Kubernetes с device-plugin | Kubernetes с NVIDIA GPU Operator и autoscaling обязательно |
| Программный стек | PyTorch DDP, DeepSpeed, Megatron-LM, NCCL | vLLM, TensorRT-LLM, NVIDIA Triton, TGI, ONNX Runtime |
| Multi-tenancy | Обычно нет — обучение занимает узел целиком | Часто через MIG (H100 — 7 инстансов) |
| Балансировка нагрузки | Не требуется — задача одна | Обязательно load balancer + очередь запросов |
| Сроки поставки | 90–150+ рабочих дней | 60–100 рабочих дней (проще конфигурация) |
| GPU | HBM/память | TDP | Форм-фактор | На что подходит |
|---|---|---|---|---|
| NVIDIA L4 (24 ГБ) | 24 ГБ GDDR6 | 72 Вт | PCIe HH-LP (низкопрофильный) | CV-модели, embedding, лёгкий LLM ≤ 7B, edge-inference |
| NVIDIA L40S (48 ГБ) | 48 ГБ GDDR6 | 350 Вт | PCIe 2-слот | Рабочая лошадка inference LLM 7B–13B, диффузия, TTS/STT, RAG-embedding |
| NVIDIA A100 40 ГБ | 40 ГБ HBM2e | 300–400 Вт | PCIe / SXM | LLM 13B–34B, mixed inference с фон-обучением |
| NVIDIA A100 80 ГБ | 80 ГБ HBM2e | 300–400 Вт | PCIe / SXM | LLM 34B–70B (FP16), длинный контекст embedding |
| NVIDIA H100 80 ГБ | 80 ГБ HBM3 | 350–700 Вт | PCIe / SXM | LLM 70B, MoE, FP8-inference через TensorRT-LLM |
| NVIDIA H200 141 ГБ | 141 ГБ HBM3e | 700 Вт | SXM | Крупные LLM 70B+ с длинным контекстом (32K+ токенов), RAG с большим окном |
| Метрика | Что означает | Куда влияет |
|---|---|---|
| Latency P50 / P95 / P99 | Задержка одного запроса в 50 / 95 / 99% случаев | SLA конечного пользователя, выбор batch size, continuous batching |
| Time-to-first-token (TTFT) | Задержка первого токена в LLM-ответе | Пользовательское восприятие «отзывчивости» интерфейса |
| Time-per-output-token (TPOT) | Задержка каждого следующего токена в LLM-стриме | Пропускная скорость чтения ответа пользователем |
| Throughput (req/sec) | Число обработанных запросов в секунду на узел | Число узлов в кластере, autoscaling |
| GPU utilization % | Загрузка GPU по вычислениям | Cost per query — простой равен перерасходу |
| KV-cache footprint | Объём HBM под key-value кэш LLM (растёт с длиной контекста) | Максимальное число параллельных сессий |
| Cost per 1M requests | Итоговая стоимость 1 миллиона запросов | Ключевая экономическая метрика проекта |
| Параметр подбора | На что влияет | Что уточняем у клиента |
|---|---|---|
| Размер модели и формат весов | GPU и HBM, квантизация (FP16 / FP8 / INT8 / INT4) | Параметры модели, поддерживает ли она FP8/INT8-квант |
| Целевой SLA по latency (P99) | Максимальный batch size, требования к TTFT и TPOT | SLA пользователя, строгость 100 мс vs 2 сек |
| Целевой QPS | Число inference-узлов, autoscaling-политика | Пиковая нагрузка, суточный профиль |
| Длина контекста LLM (input tokens) | KV-cache footprint в HBM, число параллельных сессий | Максимальный context window |
| Multi-tenancy | MIG-шардирование, изоляция моделей | Число моделей, требования к изоляции |
| Тип задачи (LLM / CV / embedding / TTS) | Inference-framework (vLLM / TensorRT / Triton / TGI) | Стек, который уже используется |
| Data-путь: где хранятся модели | Локальный NVMe 2–4 ТБ, CI/CD-загрузка новых версий | Частота обновления моделей, объём модели |
| Условия ЦОД | Мощность стойки, тип охлаждения | Обычно для inference хватает воздуха |
| Планы масштабирования | Kubernetes-autoscaling, свободные слоты в стойках | План роста, пиковые события |