Когда GPU-кластер упирается не в серверы: почему СКС важна для ИИ-нагрузок

ИИ-инфраструктуру часто обсуждают через серверы и графические ускорители. Это логично: именно они обычно находятся в центре внимания при проектировании вычислительных мощностей. Но есть слой, который не всегда получает достаточно внимания на старте, хотя способен ограничить весь проект. Это структурированная кабельная система.

На практике дорогие серверы, производительные GPU и современные коммутаторы могут не раскрыть свой потенциал, если физическая среда передачи данных не готова к таким нагрузкам. Старые линии, неподходящая оптика, неверно подобранные патч-корды, превышение допустимых длин, некачественная коммутация или отсутствие актуальной документации могут превратить мощный GPU-кластер в инфраструктуру, которая работает ниже расчётных параметров.

О том, почему СКС для ИИ-проектов нужно рассматривать не как вспомогательный слой, а как часть вычислительной архитектуры, рассказывает Андрей Зюбровский, руководитель департамента технической поддержки Компании ВИЗАРД.

Почему проблема может быть не в серверах

В проектах под ИИ главный фокус часто смещается на вычислительную часть: сколько видеокарт, какие серверы, где хранятся данные для обучения модели. Но высокая производительность — это не только характеристики оборудования. Это ещё и способность инфраструктуры стабильно передавать большие объёмы данных между узлами, хранилищами и сетевыми сегментами. Если физический уровень не соответствует требованиям, узкое место появляется там, где его меньше всего ждут.

«Можно правильно подобрать серверы и коммутаторы, но если между ними остаётся неподготовленная кабельная система, кластер не будет работать так, как рассчитывали. Для ИИ-нагрузок СКС — это уже не просто кабели в лотках, а часть общей производительности решения»,

Типовая ситуация выглядит так: оборудование укомплектовано высокоскоростными картами расширения, линк поднимается, мониторинг не показывает узких мест. Но под реальной нагрузкой появляются ошибки, падение производительности, нестабильность или ограничения на отдельных задачах. В итоге команда начинает искать проблему в серверах, настройках, драйверах, приложениях. А причина может находиться на физическом уровне: в оптических трассах, коннекторах или даже наводках на медных патч-кордах.

Почему ИИ-нагрузки требовательны к кабельной системе

ИИ-проекты гоняют огромные объёмы данных между узлами: обучение моделей, инференс, работа с большими датасетами, распределённые вычисления. Здесь важна не только мощность GPU, но и то, насколько стабильно данные передаются между компонентами. Обычная офисная СКС для этого не годится. GPU-кластеры, хранилища, резервное копирование, сети 100G/400G — это постоянная интенсивная нагрузка, и ошибки, которые раньше были незаметны, здесь вылезают сразу.

Проблема может быть где угодно: не тот тип оптики, грязные коннекторы, кабель длиннее допустимого, слишком резкий изгиб, старые патч-корды, неактуальная маркировка, отсутствие протоколов тестирования. Поэтому перед запуском ИИ-инфраструктуры физическую среду передачи данных нужно проверять так же внимательно, как и активное оборудование.

Что проверить до запуска

Оптика и коннекторы. Нужно свериться с типом трансиверов, совместимостью компонентов, классом оптики, состоянием коннекторов и тем, собран ли тракт правильно под нужную скорость. Ошибка здесь ограничит всю линию, даже если оборудование дорогое.

Трассы и длины линий. Нужно понимать, как физически проложен кабель, какие участки входят в тракт и не превышена ли допустимая длина. Для высокоскоростных сред расчёта «на глаз» уже недостаточно.

Радиус изгиба и физическое состояние кабеля. Для оптики это критично: перегибы, натяжение, плотная укладка и небрежная коммутация могут ухудшить канал, даже если внешне линия выглядит рабочей.

Измерения и протоколы тестирования. Линию нужно не просто подключить, а проверить: провести измерения и подтвердить, что она соответствует нужной скорости и условиям эксплуатации. Без протоколов тестирования качество линии остаётся непроверенным.

Маркировка и кабельные журналы. Чем больше соединений, тем дороже обходится отсутствие внятной маркировки и актуальной схемы коммутации — любое изменение превращается в расследование, особенно при авариях.

Резерв портов. ИИ-проекты редко останавливаются на первой конфигурации: после пилота обычно добавляют серверы, расширяют хранилище или меняют архитектуру сети. Если СКС спроектирована впритык, следующий этап роста упрётся в физическую инфраструктуру.

Готовность к 100G/400G. Кабельная система должна выдерживать не только текущие задачи, но и следующий этап, без полной переделки трасс, шкафов и кроссов.

«Вопрос не в том, можно ли подключить оборудование, а в том, выдержит ли кабельная система рост нагрузки. Лучше выяснить это до запуска, чем в момент, когда кластер уже должен работать в проде».

Почему документация — часть производительности

Если непонятно, какая линия куда идёт, какой порт за что отвечает, где есть резерв и что менялось после монтажа — инфраструктура становится непредсказуемой. На старте проекта это кажется мелочью, но при авариях и расширении именно отсутствие документации съедает время: команда тратит его не на развитие, а на восстановление факта того, что и так должно быть известно.

Что бывает, если СКС не готова

Иногда это просто просадка скорости на отдельных участках. Иногда, ошибки передачи, нестабильная работа, проблемы при переключении или невозможность быстро масштабировать кластер.

Хуже всего, когда проблема всплывает уже после того, как серверы установлены, коммутаторы подключены, а сроки запуска согласованы с бизнесом. Тогда график сдвигается, появляются внеплановые работы, замена компонентов и пересборка отдельных участков — ошибка на физическом уровне превращается в организационный риск.

Что делать

СКС нужно проверять до запуска, а не после первых сбоев. На этапе подготовки провести аудит: трассы, типы линий, состояние оптики и коннекторов, наличие измерений, актуальность маркировки, свободные порты, кабельные журналы, готовность к целевым скоростям.

Если инфраструктура строится с нуля, требования к СКС нужно закладывать одновременно с требованиями к серверам, СХД и сети, ответив заранее на несколько вопросов: какие скорости нужны сейчас и какие понадобятся позже, какие устройства будут связаны между собой, где нужны резервные линии, какие трассы критичны, какие измерения обязательны, кто отвечает за актуализацию документации после изменений.

Когда физический уровень не готов к нагрузке, дорогое вычислительное железо простаивает или работает медленнее, чем должно и это не всегда выглядит как авария. Линк поднимается, оборудование совместимо, а узкое место всё равно в кабеле. Проверить это до запуска дешевле, чем разбираться после.

Поделиться
Компания ВИЗАРД
Внедряем и развиваем ИТ-решения полного цикла уже более 30 лет. Мы успешно сотрудничаем с крупными корпоративными заказчиками и компаниями малого и среднего бизнеса, помогая им повышать эффективность своей деятельности.
Начните уже сегодня

Обсудить проект

Оставьте заявку и мы свяжемся с вами в ближайшее время