8 (800) 302-34-73

Запуск DeepSeek локально: какая конфигурация сервера нужна

23 сентября 2026 г.

Запуск DeepSeek локально требует разного оборудования в зависимости от версии модели. Узнайте, сколько видеопамяти нужно для полной R1 и дистиллированных версий, когда требуется несколько GPU и как выбрать конфигурацию сервера.

Запуск DeepSeek локально: какая конфигурация сервера нужна

Запуск DeepSeek локально обеспечивает конфиденциальность данных: запросы и ответы остаются внутри инфраструктуры компании, но требования к серверу зависят от выбранной версии модели. Полная DeepSeek-R1 содержит около 671 млрд параметров и не относится к системам для одной рабочей станции, а дистиллированные варианты от 1,5 до 70 млрд параметров требуют на порядки меньше памяти и подходят для одного сервера. До закупки определите размер модели и точность весов. Ожидаемая длина контекста тоже меняет необходимый объем видеопамяти.

Серверная стойка с несколькими графическими ускорителями, голубое свечение от светодиодов, минималистичная техническая атмосфера.

Какие версии DeepSeek существуют: полная модель и дистиллированные

DeepSeek-R1 построена на архитектуре Mixture of Experts. Общее число параметров составляет около 671 млрд, однако при обработке одного токена, по официальным данным разработчика, активируется около 37 млрд параметров, остальные эксперты в вычислении не участвуют. Это снижает объем вычислений по сравнению с плотной моделью того же общего размера, но не отменяет необходимость хранить веса. Для локального запуска полной версии требуется распределенная конфигурация с очень большим суммарным объемом памяти.

Разработчик также опубликовал шесть дистиллированных моделей. В линейку входят варианты на базе Qwen с 1,5 млрд и 7 млрд параметров. Есть версии Qwen 14B и 32B. Два варианта построены на Llama: 8B и 70B. Дистилляция переносит часть поведения большой модели в меньшую плотную архитектуру, поэтому такие версии проще развернуть, но они не равны полной DeepSeek-R1 по возможностям.

Выбор начинается не с названия DeepSeek, а с конкретного checkpoint. Указание только R1 в техническом задании недостаточно: полная MoE-модель и Distill-Qwen-7B требуют принципиально разного оборудования. Зафиксируйте также формат весов, поскольку BF16 и 4-битное квантование дают разную нагрузку на память.

Сколько видеопамяти нужно для полной модели DeepSeek-R1

Официальные данные разработчика определяют размер модели, но не дают единой конфигурации сервера для запуска DeepSeek R1 локально на каждом движке инференса. Поэтому требования к памяти корректно оценивать по весам и добавлять запас на служебные буферы. DeepSeek-R1 обучена и распространяется нативно в 8-битном формате FP8, это не квантование, а исходная точность модели. При таком формате веса 671 млрд параметров занимают ориентировочно 670-700 ГБ, и именно эта цифра — отправная точка для расчета, а не результат сжатия. Если GPU не поддерживает FP8 на аппаратном уровне, например NVIDIA A100, веса приходится конвертировать в BF16, тогда объем удваивается примерно до 1,34 ТБ. Фактический запуск в любом случае добавит память под KV-кеш и коммуникационные буферы. Дополнительное 4-битное квантование позволяет снизить объем весов еще примерно до 336 ГБ ценой части качества. Эти числа не являются готовым размером сервера: реализация квантования использует метаданные, а длинный контекст увеличивает KV-кеш.

Формат весов определяет объем видеопамяти сильнее, чем название checkpoint: ниже сведены базовые конфигурации DeepSeek-R1 и дистиллированных версий.

Конфигурации DeepSeek-R1 и дистиллированных версий

Модель

Параметры

Формат

GPU (пример)

Видеопамять

DeepSeek-R1 671B

671 млрд

FP8 (нативный)

8 GPU от 80 ГБ, например H200 или H20

около 700 ГБ

DeepSeek-R1 671B

671 млрд

BF16 (конвертация)

16 GPU от 80 ГБ, например A100 или A800

около 1,34 ТБ

DeepSeek-R1 671B

671 млрд

INT4 (квантование)

несколько GPU от 80 ГБ

около 336 ГБ

Distill-Llama-70B

70 млрд

BF16

2 GPU на 80 ГБ

около 140 ГБ

Distill-Qwen-32B

32 млрд

BF16

1 GPU на 80 ГБ

около 64 ГБ

Distill-Qwen-7B или Llama-8B

7-8 млрд

BF16

1 GPU на 16-24 ГБ

около 16 ГБ

Графические ускорители для ИИ-задач подбирают по суммарной видеопамяти и поддерживаемому формату вычислений. NVIDIA H100 и A100 доступны в конфигурациях с большим объемом памяти, но одной карты для полной модели недостаточно. RTX 6000 Ada может применяться для меньших checkpoint и тестовых контуров, а не как одиночное устройство для 671B.

На GPU с аппаратной поддержкой FP8, например видеокарты для ИИ-инфраструктуры, нативная точность модели без какого-либо квантования обычно умещается в одном сервере на восемь карт с достаточным объемом памяти на карту. На GPU без поддержки FP8 конфигурация требует конвертации в BF16 и, как следствие, кратно большего числа карт — здесь расчет чаще приводит к нескольким серверам. Чем больше узлов участвует в размещении модели, тем выше требования к межузловой сети. Помимо объема памяти нужно оценить скорость генерации: модель может формально запуститься, но выдавать недостаточное число токенов в секунду для рабочего сервиса.

Несколько видеокарт NVIDIA высокого класса на столе, отражение света на металлических корпусах, профессиональная производственная среда.

Требования к серверу для дистиллированных версий

Ниже приведены ориентиры для тех, кто планирует запуск DeepSeek R1 локально на своем компьютере или сервере: цифры для весов и базового инференса. Они зависят от движка, длины контекста и числа параллельных запросов. Значения нельзя использовать как точную спецификацию без теста выбранного checkpoint.

Требования видеопамяти для дистиллированных версий

Версия

Параметры

Ориентир по видеопамяти

Практическая конфигурация

Distill-Qwen-1.5B

1,5 млрд

около 2-4 ГБ

одна GPU с запасом от 8 ГБ

Distill-Qwen-7B или Llama-8B

7-8 млрд

около 5-10 ГБ

одна GPU на 12-16 ГБ

Distill-Qwen-14B

14 млрд

около 10-20 ГБ

одна GPU на 24 ГБ или больше

Distill-Qwen-32B

32 млрд

около 20-40 ГБ

одна GPU на 48 ГБ или две карты

Distill-Llama-70B

70 млрд

около 40-80 ГБ

GPU на 80 ГБ либо несколько карт

Полная DeepSeek-R1

671 млрд

сотни ГБ даже после квантования

несколько многокарточных серверов

Нижняя граница таблицы ближе к 4-битным весам. Верхняя граница диапазона предполагает 8-битное квантование, а не полную точность BF16: без квантования версии 32B и 70B почти всегда требуют GPU на 80 ГБ или несколько карт. Для длинного контекстного окна запас увеличивают, поскольку KV-кеш растет с числом токенов и одновременных последовательностей.

Младшие модели на 1,5-8 млрд параметров умещаются на одной потребительской видеокарте и подходят для пилотного проекта с ограниченным контекстом. Версия 14B работает на одной профессиональной карте. Для версий 32B и 70B таблица выше задает диапазон — точное число карт зависит от точности весов и разбирается в следующем разделе.

Многокарточная конфигурация: когда одного GPU недостаточно

Несколько карт нужны в двух случаях. Первый — веса модели физически не помещаются в память одного ускорителя. Второй — одной GPU хватает по объему, но не хватает производительности для требуемого числа параллельных запросов. Эти сценарии нельзя смешивать: tensor parallelism решает размещение одной копии модели, а несколько реплик повышают пропускную способность сервиса.

Внутри сервера модель распределяют по GPU с помощью движка инференса. Конфигурация должна учитывать топологию PCIe и доступность прямых связей. Если карты соединены только через общую шину PCIe без прямых межкарточных линков, например NVLink или NVSwitch, добавление ускорителей увеличивает объем памяти, но синхронизация тензоров между картами становится узким местом — прирост скорости инференса будет ниже пропорционального числу GPU. Для версии 32B две карты часто используют ради памяти. Для 70B многокарточный режим становится обычным даже при квантовании.

При расчете нужно оставить запас под KV-кеш. Сервис с одним пользователем и короткими запросами потребляет меньше памяти, чем API с длинным контекстом и параллельными сессиями. Поэтому тест на одиночном prompt не подтверждает готовность производственного сервера.

Роль NVLink и InfiniBand при мультикарточном запуске

NVLink или NVSwitch ускоряет обмен между GPU внутри одного сервера. Это важно, когда слои модели или тензоры распределены между картами. Подбор сервера с NVLink для нескольких GPU должен учитывать не только число ускорителей, но и фактическую схему прямых связей: одинаковое количество карт не гарантирует одинаковую полосу между каждой парой.

InfiniBand или RDMA over Converged Ethernet применяется между серверами. Для полной DeepSeek-R1 сетевой обмен становится частью каждого шага инференса, поэтому обычный канал может превратить кластер в систему с большим объемом памяти, но низкой скоростью ответа. RDMA сокращает участие CPU, а GPUDirect RDMA уменьшает промежуточные копирования между памятью GPU и сетевым адаптером.

Не следует добавлять второй сервер только ради свободного слота, не рассчитав коммуникации. Межузловой tensor parallelism чувствительнее к задержке, чем независимые реплики. Если модель помещается в один восьмикарточный узел, такой вариант обычно проще в настройке. Несколько серверов оправданы, когда суммарная память или целевая производительность действительно требуют распределения.

Квантование: как снизить требования к памяти

Квантование уменьшает число битов, которыми представлены веса модели. Переход с BF16 к 8 битам примерно вдвое сокращает объем весов. Переход к 4 битам дает около четырехкратного уменьшения относительно BF16. Реальная экономия немного отличается из-за служебных данных и формата групп квантования.

Цена снижения точности — возможная потеря качества и изменение скорости. Не каждый 4-битный формат одинаково подходит для конкретного движка. Один вариант экономит память, но медленнее декодируется. Другой дает высокую скорость на поддерживаемой архитектуре GPU, однако требует определенной версии библиотеки.

Для пилота полезно сравнить как минимум две конфигурации: более точную на меньшем числе параллельных запросов и квантованную с рабочей нагрузкой. Оценивайте не только субъективное качество ответа. Измеряйте токены в секунду и задержку первого токена. Отдельно проверяйте результаты на внутренних задачах компании.

Полную DeepSeek-R1 квантование делает доступнее, но не превращает ее в модель для одной карты. Даже теоретические 4-битные веса занимают сотни гигабайт. Для дистиллированных checkpoint эффект практичнее: 32B может перейти из двухкартной конфигурации в одну карту с большой памятью, а 70B — сократить число ускорителей.

Мониторинг производительности серверов на экране, графики использования GPU и памяти, фон с линиями данных.

Как выбрать конфигурацию под свой сценарий запуска

Прежде чем решать, как запустить DeepSeek локально, зафиксируйте четыре параметра.

  • Какой checkpoint запускается: полная модель или конкретная дистиллированная версия;
  • Какой формат весов используется: BF16, FP8 или квантованный;
  • Сколько параллельных последовательностей нужно;
  • С каким запасом помещается KV-кеш.

Для типового корпоративного пилота можно начать с готовой конфигурации сервера для локального запуска LLM и адаптировать эту конфигурацию под выбранный checkpoint. Для полной модели нужен отдельный проект нескольких узлов и сети, который стоит протестировать на целевых запросах до масштабной закупки. Название модели само по себе оборудование не определяет: его определяют перечисленные параметры.