8 (800) 302-34-73

Как масштабировать сеть при росте трафика

6 октября 2026 г.

Методика поиска узкого места: восемь ограничителей, необходимые метрики, стратегии расширения сети и порядок вложений при росте трафика.

Как масштабировать сеть при росте трафика

Расширить полосу и снять узкое место — разные задачи. Масштабирование сети начинают не с выбора скорости портов, а с профиля нагрузки: длительная утилизация канала, pps, egress drops, очереди, таблицы состояний, CPU и end-to-end latency. Эти данные отделяют нехватку полосы от лимита обработки или сервиса и задают порядок вложений при росте трафика.

Почему расширение канала часто не помогает

Канал — один из возможных ограничителей. Вместе с ним проверяют pps, очереди и буферы, служебные таблицы, CPU и состояние шлюза, а также производительность серверного сервиса.

Пропускная способность аплинка ограничивает сеть при длительной перегрузке выхода. Другие пределы проявляются иначе. При исчерпании FDB возможны unknown-unicast flooding или отказ обучения. При нехватке ARP, FIB или ACL/TCAM новая запись может не установиться, пакет может быть отброшен или обработан по резервному пути. Поведение зависит от платформы, поэтому таблицу MAC-адресов и аппаратные ресурсы проверяют раздельно.

Средняя утилизация 70% не доказывает запас. Сопоставьте короткоинтервальную телеметрию с egress queue drops, глубиной очереди и p95/p99 задержки. Пятиминутные графики показывают длительную перегрузку, но не исключают микровсплески, поэтому решение нельзя принимать по одному среднему значению.

Сначала зафиксируйте измеряемый симптом: throughput, p95/p99 latency, loss, retransmissions, failed new connections или время ответа приложения.

Где искать узкое место

Как масштабировать сеть при росте трафика — иллюстрация к разделу «Где искать узкое место»
Иллюстрация к материалу

Узкое место

Как проявляется

Чем проверяется

Полоса аплинка

Деградация в вечерний пик, утилизация близка к предельной

Графики утилизации интерфейсов за период

Производительность в пакетах

Загрузка канала неполная, а задержки растут

Счетчики пакетов в секунду, распределение размеров

Буферы коммутатора

Потери при сходящихся потоках, повторные передачи

Счетчики отбрасываний на портах

Переполнение таблицы MAC-адресов

Unknown-unicast flooding или отказ обучения новых адресов в пределах VLAN

Текущее число записей против максимума

Переполнение таблиц ARP, маршрутов и правил фильтрации

Новая запись может не установиться, возможны drops или документированный software fallback

Число аппаратно обрабатываемых записей против максимума

Производительность шлюза

Высокая загрузка процессора устройства при свободном канале

Мониторинг ресурсов самого устройства

Число сессий при трансляции адресов

Новые соединения не создаются либо исчерпываются внешние адреса и порты

Active sessions, new connections per second, failures создания state, port pool и CPU

Дисковая подсистема серверов

Растет время отклика сервисов, а не сети

Задержки дисковых операций, очередь запросов

Таблица служит первичным фильтром. Сочетание свободного канала и растущей задержки сужает поиск до обработки пакетов, очередей и backend-сервиса.

При нормальной полосе и отказе новых соединений проверьте session table, скорость создания соединений, внешний пул адресов и портов, CPU и причины завершения сессий.

Что снять с сети до того, как считать бюджет

Минимальный набор данных, без которого выбор оборудования делается наугад:

Утилизация интерфейсов: 30–60-секундные counters минимум за полный бизнес-цикл с вечерними пиками, резервным копированием, отчетными днями и инцидентными окнами.

Производительность в пакетах и распределение размеров пакетов. Это то, что отличает сеть с преобладанием видеотрафика от сети с большим числом коротких служебных обменов.

Ошибки, отбрасывание пакетов и per-queue counters. Для микровсплесков используйте доступную платформе streaming telemetry, поскольку средняя загрузка их не показывает.

CPU и память сетевых устройств. Сопоставляйте аппаратно перенаправленный трафик и пакеты, переданные в control plane, отдельно от загрузки интерфейсов.

Задержка, loss и TCP retransmissions. Рост повторных передач указывает на возможные потери, изменение порядка или таймауты, поэтому причину локализуют по packet capture, счетчикам очередей и end-to-end probes.

Если мониторинга сети нет, начните с ingress/egress octets и packets, errors/discards, pps, CPU, памяти, active/new sessions и синтетической задержки. Синхронизируйте время источников и выберите период, который включает полный цикл нагрузки.

Вертикально или горизонтально: две стратегии

Вертикальное расширение — замена устройства на более производительное. Быстро, понятно, не требует пересмотра схемы. Ограничения: упирается в потолок доступных моделей, а единственное мощное устройство остается единственной точкой отказа. Вложения при этом разовые и крупные.

Горизонтальное масштабирование добавляет устройства и создает возможность резервирования, но не гарантирует доступность. Проверьте независимые пути и питание, протокол сходимости, синхронизацию состояния для stateful-функций, dual-homing и поведение приложений. Критерий результата — измеренный failover без нарушения SLA.

Вертикальное масштабирование увеличивает ресурс одного узла. Если SLA требует работу при его отказе, сравнивайте стратегии по fault domains, времени сходимости и сохранению состояния, а не только по производительности.

На уровне доступа обычно добавляют новые узлы по географии подключений. На агрегации и в ядре стратегии комбинируют, но пара устройств работает как резерв только при независимых путях, питании и корректной схеме переключения.

Если устойчивость к отказу отдельных элементов — приоритет, схему проектируют сразу с резервированием путей и устройств: типовые решения собраны в разделе отказоустойчивой сети.

Что решается настройкой, а не закупкой

До замены основного оборудования проверьте конфигурацию и трафик-инжиниринг. Каждое изменение все равно оценивают по трудозатратам, лицензиям и дополнительным ресурсам.

Как масштабировать сеть при росте трафика — иллюстрация к разделу «Что решается настройкой, а не закупкой»
Иллюстрация к материалу

Сегментация VLAN уменьшает размер L2-домена широковещания и область flooding. Эффект на полосу аплинка зависит от матрицы трафика и маршрутизации между VLAN.

Агрегация каналов распределяет потоки хешированием. Если один участник LAG насыщен при свободной группе, проверьте крупные потоки, поля хеша и поддержку внутренних заголовков туннелей. Смена хеша или новый линк помогают при достаточном числе независимых потоков. Для одного крупного потока пределом остается скорость физического порта.

Пиринг и кэширование могут уменьшить транзитный трафик, но нагружают локальные порты и внутренний путь. До внедрения сравните hit ratio, матрицу локального трафика и емкость этих участков.

QoS не увеличивает общую полосу. На перегруженном выходе приоритезация трафика меняет порядок обслуживания классов. Предсказуемый результат требует классификации, доверия к DSCP, shaping или policing и согласованных очередей на всех узких участках.

Конкретные меры выбирают по обследованию. Когда подтверждено, что ограничение снимается настройкой, оптимизация сети может отложить замену оборудования без ухудшения SLA.

Порядок расширения: что менять первым

Действуйте по пяти проверяемым шагам.

  1. Соберите baseline по трафику, пакетам, очередям, таблицам, состояниям и задержке.
  2. Локализуйте bottleneck по end-to-end цепочке.
  3. Сформулируйте гипотезу изменения и ожидаемую метрику.
  4. Проверьте ее на ограниченном участке и сравните показатели до и после.
  5. Составьте capacity plan с запасом под прогноз подключений и аварийный режим.

Модернизация ядра при прежней агрегации только переносит ограничение. Изменение проверяют на зависимых участках независимо от того, находится узкое место на доступе, агрегации, ядре, шлюзе или сервисе.

Переходите от подтвержденного bottleneck к связанным участкам, а результат принимайте по изменению целевой метрики и соблюдению SLA.

Что не решает проблему пропускной способности

Честный список того, на что не стоит рассчитывать.

Резервный канал повышает доступность, но не пропускную способность, если работает в холодном резерве и включается только при аварии основного. Полосу он добавит лишь в схеме, где оба канала используются одновременно с распределением нагрузки.

Замена устройства на более дорогое не поможет, если ограничение находится на другом участке. Проверяйте изменение по заранее выбранной метрике.

Увеличение числа портов не увеличивает полосу аплинка. Больше подключений при той же полосе вверх означает только рост переподписки.

Более скоростные абонентские подключения сами по себе тоже ничего не дают, если агрегация и ядро остаются прежними: тариф вырастет на бумаге, а фактическая скорость в пик — нет.

Измерить, локализовать, устранить

Масштабирование сети строится на последовательности «измерить, локализовать, устранить», а бюджет следует за подтвержденным ограничением.

Снимите данные за полный цикл нагрузки, определите ограничитель, проверьте настройку или изменение архитектуры и только затем рассчитывайте закупку с запасом.

Передайте поставщику baseline, целевые метрики и требования к штатному и аварийному режимам. Подбор сетевого оборудования тогда ведется по измеряемым параметрам, а не по общему классу модели.