Запуск DeepSeek локально обеспечивает конфиденциальность данных: запросы и ответы остаются внутри инфраструктуры компании, но требования к серверу зависят от выбранной версии модели. Полная DeepSeek-R1 содержит около 671 млрд параметров и не относится к системам для одной рабочей станции, а дистиллированные варианты от 1,5 до 70 млрд параметров требуют на порядки меньше памяти и подходят для одного сервера. До закупки определите размер модели и точность весов. Ожидаемая длина контекста тоже меняет необходимый объем видеопамяти.

Какие версии DeepSeek существуют: полная модель и дистиллированные
DeepSeek-R1 построена на архитектуре Mixture of Experts. Общее число параметров составляет около 671 млрд, однако при обработке одного токена, по официальным данным разработчика, активируется около 37 млрд параметров, остальные эксперты в вычислении не участвуют. Это снижает объем вычислений по сравнению с плотной моделью того же общего размера, но не отменяет необходимость хранить веса. Для локального запуска полной версии требуется распределенная конфигурация с очень большим суммарным объемом памяти.
Разработчик также опубликовал шесть дистиллированных моделей. В линейку входят варианты на базе Qwen с 1,5 млрд и 7 млрд параметров. Есть версии Qwen 14B и 32B. Два варианта построены на Llama: 8B и 70B. Дистилляция переносит часть поведения большой модели в меньшую плотную архитектуру, поэтому такие версии проще развернуть, но они не равны полной DeepSeek-R1 по возможностям.
Выбор начинается не с названия DeepSeek, а с конкретного checkpoint. Указание только R1 в техническом задании недостаточно: полная MoE-модель и Distill-Qwen-7B требуют принципиально разного оборудования. Зафиксируйте также формат весов, поскольку BF16 и 4-битное квантование дают разную нагрузку на память.
Сколько видеопамяти нужно для полной модели DeepSeek-R1
Официальные данные разработчика определяют размер модели, но не дают единой конфигурации сервера для запуска DeepSeek R1 локально на каждом движке инференса. Поэтому требования к памяти корректно оценивать по весам и добавлять запас на служебные буферы. DeepSeek-R1 обучена и распространяется нативно в 8-битном формате FP8, это не квантование, а исходная точность модели. При таком формате веса 671 млрд параметров занимают ориентировочно 670-700 ГБ, и именно эта цифра — отправная точка для расчета, а не результат сжатия. Если GPU не поддерживает FP8 на аппаратном уровне, например NVIDIA A100, веса приходится конвертировать в BF16, тогда объем удваивается примерно до 1,34 ТБ. Фактический запуск в любом случае добавит память под KV-кеш и коммуникационные буферы. Дополнительное 4-битное квантование позволяет снизить объем весов еще примерно до 336 ГБ ценой части качества. Эти числа не являются готовым размером сервера: реализация квантования использует метаданные, а длинный контекст увеличивает KV-кеш.
Формат весов определяет объем видеопамяти сильнее, чем название checkpoint: ниже сведены базовые конфигурации DeepSeek-R1 и дистиллированных версий.
Конфигурации DeepSeek-R1 и дистиллированных версий
Модель | Параметры | Формат | GPU (пример) | Видеопамять |
|---|---|---|---|---|
DeepSeek-R1 671B | 671 млрд | FP8 (нативный) | 8 GPU от 80 ГБ, например H200 или H20 | около 700 ГБ |
DeepSeek-R1 671B | 671 млрд | BF16 (конвертация) | 16 GPU от 80 ГБ, например A100 или A800 | около 1,34 ТБ |
DeepSeek-R1 671B | 671 млрд | INT4 (квантование) | несколько GPU от 80 ГБ | около 336 ГБ |
Distill-Llama-70B | 70 млрд | BF16 | 2 GPU на 80 ГБ | около 140 ГБ |
Distill-Qwen-32B | 32 млрд | BF16 | 1 GPU на 80 ГБ | около 64 ГБ |
Distill-Qwen-7B или Llama-8B | 7-8 млрд | BF16 | 1 GPU на 16-24 ГБ | около 16 ГБ |
Графические ускорители для ИИ-задач подбирают по суммарной видеопамяти и поддерживаемому формату вычислений. NVIDIA H100 и A100 доступны в конфигурациях с большим объемом памяти, но одной карты для полной модели недостаточно. RTX 6000 Ada может применяться для меньших checkpoint и тестовых контуров, а не как одиночное устройство для 671B.
На GPU с аппаратной поддержкой FP8, например видеокарты для ИИ-инфраструктуры, нативная точность модели без какого-либо квантования обычно умещается в одном сервере на восемь карт с достаточным объемом памяти на карту. На GPU без поддержки FP8 конфигурация требует конвертации в BF16 и, как следствие, кратно большего числа карт — здесь расчет чаще приводит к нескольким серверам. Чем больше узлов участвует в размещении модели, тем выше требования к межузловой сети. Помимо объема памяти нужно оценить скорость генерации: модель может формально запуститься, но выдавать недостаточное число токенов в секунду для рабочего сервиса.

Требования к серверу для дистиллированных версий
Ниже приведены ориентиры для тех, кто планирует запуск DeepSeek R1 локально на своем компьютере или сервере: цифры для весов и базового инференса. Они зависят от движка, длины контекста и числа параллельных запросов. Значения нельзя использовать как точную спецификацию без теста выбранного checkpoint.
Требования видеопамяти для дистиллированных версий
Версия | Параметры | Ориентир по видеопамяти | Практическая конфигурация |
|---|---|---|---|
Distill-Qwen-1.5B | 1,5 млрд | около 2-4 ГБ | одна GPU с запасом от 8 ГБ |
Distill-Qwen-7B или Llama-8B | 7-8 млрд | около 5-10 ГБ | одна GPU на 12-16 ГБ |
Distill-Qwen-14B | 14 млрд | около 10-20 ГБ | одна GPU на 24 ГБ или больше |
Distill-Qwen-32B | 32 млрд | около 20-40 ГБ | одна GPU на 48 ГБ или две карты |
Distill-Llama-70B | 70 млрд | около 40-80 ГБ | GPU на 80 ГБ либо несколько карт |
Полная DeepSeek-R1 | 671 млрд | сотни ГБ даже после квантования | несколько многокарточных серверов |
Нижняя граница таблицы ближе к 4-битным весам. Верхняя граница диапазона предполагает 8-битное квантование, а не полную точность BF16: без квантования версии 32B и 70B почти всегда требуют GPU на 80 ГБ или несколько карт. Для длинного контекстного окна запас увеличивают, поскольку KV-кеш растет с числом токенов и одновременных последовательностей.
Младшие модели на 1,5-8 млрд параметров умещаются на одной потребительской видеокарте и подходят для пилотного проекта с ограниченным контекстом. Версия 14B работает на одной профессиональной карте. Для версий 32B и 70B таблица выше задает диапазон — точное число карт зависит от точности весов и разбирается в следующем разделе.
Многокарточная конфигурация: когда одного GPU недостаточно
Несколько карт нужны в двух случаях. Первый — веса модели физически не помещаются в память одного ускорителя. Второй — одной GPU хватает по объему, но не хватает производительности для требуемого числа параллельных запросов. Эти сценарии нельзя смешивать: tensor parallelism решает размещение одной копии модели, а несколько реплик повышают пропускную способность сервиса.
Внутри сервера модель распределяют по GPU с помощью движка инференса. Конфигурация должна учитывать топологию PCIe и доступность прямых связей. Если карты соединены только через общую шину PCIe без прямых межкарточных линков, например NVLink или NVSwitch, добавление ускорителей увеличивает объем памяти, но синхронизация тензоров между картами становится узким местом — прирост скорости инференса будет ниже пропорционального числу GPU. Для версии 32B две карты часто используют ради памяти. Для 70B многокарточный режим становится обычным даже при квантовании.
При расчете нужно оставить запас под KV-кеш. Сервис с одним пользователем и короткими запросами потребляет меньше памяти, чем API с длинным контекстом и параллельными сессиями. Поэтому тест на одиночном prompt не подтверждает готовность производственного сервера.
Роль NVLink и InfiniBand при мультикарточном запуске
NVLink или NVSwitch ускоряет обмен между GPU внутри одного сервера. Это важно, когда слои модели или тензоры распределены между картами. Подбор сервера с NVLink для нескольких GPU должен учитывать не только число ускорителей, но и фактическую схему прямых связей: одинаковое количество карт не гарантирует одинаковую полосу между каждой парой.
InfiniBand или RDMA over Converged Ethernet применяется между серверами. Для полной DeepSeek-R1 сетевой обмен становится частью каждого шага инференса, поэтому обычный канал может превратить кластер в систему с большим объемом памяти, но низкой скоростью ответа. RDMA сокращает участие CPU, а GPUDirect RDMA уменьшает промежуточные копирования между памятью GPU и сетевым адаптером.
Не следует добавлять второй сервер только ради свободного слота, не рассчитав коммуникации. Межузловой tensor parallelism чувствительнее к задержке, чем независимые реплики. Если модель помещается в один восьмикарточный узел, такой вариант обычно проще в настройке. Несколько серверов оправданы, когда суммарная память или целевая производительность действительно требуют распределения.
Квантование: как снизить требования к памяти
Квантование уменьшает число битов, которыми представлены веса модели. Переход с BF16 к 8 битам примерно вдвое сокращает объем весов. Переход к 4 битам дает около четырехкратного уменьшения относительно BF16. Реальная экономия немного отличается из-за служебных данных и формата групп квантования.
Цена снижения точности — возможная потеря качества и изменение скорости. Не каждый 4-битный формат одинаково подходит для конкретного движка. Один вариант экономит память, но медленнее декодируется. Другой дает высокую скорость на поддерживаемой архитектуре GPU, однако требует определенной версии библиотеки.
Для пилота полезно сравнить как минимум две конфигурации: более точную на меньшем числе параллельных запросов и квантованную с рабочей нагрузкой. Оценивайте не только субъективное качество ответа. Измеряйте токены в секунду и задержку первого токена. Отдельно проверяйте результаты на внутренних задачах компании.
Полную DeepSeek-R1 квантование делает доступнее, но не превращает ее в модель для одной карты. Даже теоретические 4-битные веса занимают сотни гигабайт. Для дистиллированных checkpoint эффект практичнее: 32B может перейти из двухкартной конфигурации в одну карту с большой памятью, а 70B — сократить число ускорителей.

Как выбрать конфигурацию под свой сценарий запуска
Прежде чем решать, как запустить DeepSeek локально, зафиксируйте четыре параметра.
- Какой checkpoint запускается: полная модель или конкретная дистиллированная версия;
- Какой формат весов используется: BF16, FP8 или квантованный;
- Сколько параллельных последовательностей нужно;
- С каким запасом помещается KV-кеш.
Для типового корпоративного пилота можно начать с готовой конфигурации сервера для локального запуска LLM и адаптировать эту конфигурацию под выбранный checkpoint. Для полной модели нужен отдельный проект нескольких узлов и сети, который стоит протестировать на целевых запросах до масштабной закупки. Название модели само по себе оборудование не определяет: его определяют перечисленные параметры.
