Сергей Махлин и Александр Бледных, К2Тех: Строить ЦОД «с запасом» — не значит закупать мощности впрок

Опубликовано: 21 сентября 2026 · Источник: TAdviser

Александр
Бледных «Запас на будущее» — это не избыточная мощность сегодня, а архитектурная возможность этой мощности легко и дешево масштабироваться завтра.

Если сравнить проекты создания ЦОД год-два назад и сегодня, что сильнее всего изменилось в требованиях заказчиков?

Александр Бледных: Большая часть запросов по-прежнему приходится на корпоративные ЦОД. Здесь требования давно сформировались: это зрелый сегмент с понятными стандартами. Основные вопросы связаны скорее с выбором оборудования, его происхождением и доступностью на длительном горизонте.

Одновременно растет число запросов на инфраструктуру для ИИ. Крупных проектов в России пока немного, но в прошлом году довольно многие наши заказчики создавали тестовые сегменты для ИИ-кластеров. Если пилот показывал реальную пользу для бизнеса, следующим шагом становился выделенный контур. А это уже другие требования к сети: поддержка технологий прямого доступа к памяти, низкие задержки, порты 400 Гбит/с и выше.

Сергей
Махлин Если ИИ-кластер требует увеличить общую мощность ЦОД даже на 10-15%, модернизация фактически превращается в перестройку объекта.

ИИ называют одним из главных факторов роста нагрузки на ЦОД. Насколько это уже заметно в реальных проектах? Что именно приходится менять при появлении GPU-кластеров?

Сергей Махлин: Влияние становится заметным, хотя рынок пока поляризован. Средняя мощность стойки в коммерческих ЦОД все еще держится на уровне 6–12 кВт, и для подавляющего большинства корпоративных задач этого хватает. Есть компании, которые создают и развивают собственные языковые модели и нуждаются в большом количестве GPU для их обучения, но массовым это явление пока не стало.

При появлении большого GPU-кластера инфраструктуру приходится пересобирать на всех уровнях. В охлаждении классический теплосъем воздухом нужно будет дополнять жидкостным охлаждением чипов, распределение электроэнергии в стойке тоже поменяется, а в сетевой части кластеры обучения требуют специализированных фабрик с минимальными задержками и колоссальным объемом оптической коммутации.

Александр Бледных: Наибольшее влияние на рост нагрузки в ЦОД ИИ оказывает в сегменте компаний, традиционно находящихся на пике технологического развития и предоставляющих услуги на основе технологий искусственного интеллекта. Требования к выделенным контурам для ИИ также все чаще появляются у промышленных, транспортных и нефтедобывающих компаний. В сетевой части это означает прежде всего рост внутрицодового трафика: требуется больше портов на стойку, растут скорости, ужесточаются требования к задержкам и стабильности под нагрузкой. Меняется и подход к тестированию. Раньше заказчик зачастую ограничивался проверкой функциональности оборудования, сейчас все чаще требуется тестирование под реальной нагрузкой.

Что касается корпоративных ЦОД в компаниях, не предоставляющих услуг на основе ИИ, то здесь потребление вычислительных ресурсов увеличивается более плавно, предсказуемо и связано, прежде всего, с экспонентным ростом трафика, используемого внутрикорпоративными системами.

В целом же ситуация очень неоднородна. Одни заказчики закупают инфраструктуру под конкретные кластеры, другие пока создают запас по портовой емкости, оптике, кроссам и архитектуре leaf-spine, чтобы не столкнуться с ограничениями через полгода-год. Но в обоих случаях ИИ уже влияет на архитектурные решения.

Можно ли существующий ЦОД относительно безболезненно подготовить к ИИ-нагрузкам или высокоплотные вычисления требуют новой площадки?

Сергей Махлин: Модернизация оправдана, когда общая электрическая мощность площадки сохраняется, а меняется лишь ее распределение. Например, вместо 50 стоек по 8 кВт заказчик хочет развернуть десять по 40 кВт. Тогда можно ограничиться локальными доработками: выделить изолированную зону, поставить рядные кондиционеры или смонтировать внутристоечные контуры охлаждения.

Если же размещение ИИ-кластера требует наращивания общей мощности ЦОДа сверх проектной даже на 10-15%, модернизация превращается в перестройку. Инженерный комплекс рассчитан как единая цепочка: придется менять трансформаторы, усиливать ГРЩ, наращивать емкость ИБП и мощность дизель-генераторов. В такой ситуации попытка переделать работающий объект будет проблематичной, и в отличии от строительства нового объекта, могут проявиться архитектурно-строительные ограничения.

Высокоплотные вычисления вернули в центр внимания жидкостное охлаждение. Где оно действительно необходимо, а где по-прежнему достаточно воздуха?

Сергей Махлин: Риск заложить избыточную инфраструктуру сейчас очень высок. На волне общего ажиотажа некоторые заказчики пытаются внедрять жидкостные контуры в типовые корпоративные дата-центры, где крутятся обычные учетные базы данных и почта. Это приводит к замораживанию бюджетов в дорогостоящей гидравлике и водоподготовке, которые могут годами не использоваться.

Воздушное охлаждение сохраняет актуальность: при мощности до 25–30 кВт на стойку это обоснованное и технически понятное решение. Технический и экономический порог проходит в районе 35-40 кВт. Выше этой планки охлаждать только воздухом нерационально: габариты климатических установок съедают полезную площадь машзала, а вентиляторы серверов начинают потреблять неоправданно много энергии.

Оптимальная стратегия — гибридная готовность. При проектировании внешнего контура коллекторы рассчитываются на отвод тепла с температурой теплоносителя 40-50°C через сухие градирни без включения компрессоров. На этих магистралях заранее предусматриваются фланцевые отводы. Пока нагрузка стандартная, зал работает на воздухе; когда же появляется стойка с прямым жидкостным охлаждением кристаллов, ее подключают к готовым выводам за считанные дни.

Насколько сети уже работающих ЦОД готовы к таким нагрузкам? Их можно последовательно модернизировать или для высокопроизводительных вычислений зачастую приходится создавать отдельный сетевой контур?

Александр Бледных: Большинство классических сетей действующих ЦОД, построенных на традиционных трехуровневых архитектурах или стандартном leaf-spine с пропускной способностью 10/25/100 Гбит/с, к таким нагрузкам не готовы. Причина не столько в общей пропускной способности, сколько в характере трафика. Обучение LLM создает всплески передачи данных и предъявляет жесткие требования к задержкам. Потеря пакетов и рост задержек снижают эффективность дорогостоящих GPU: ускорители простаивают в ожидании данных.

Последовательная модернизация возможна только в рамках обновления железа (переход на 400/800 Гбит/с) и внедрения технологий предотвращения задержек, таких как PFC (Priority Flow Control) и ECN.

Однако даже при этом стандартный Ethernet часто становится «бутылочным горлышком». Для достижения максимальной производительности в HPC-задачах требуется переход на специализированные протоколы, такие как RDMA over Converged Ethernet (RoCE v2) или InfiniBand. Российские производители в InfiniBand практически не идут, а вот RoCE v2 — в приоритете у большинства из них.

Источник: TAdviser · Оригинал статьи: Сергей Махлин и Александр Бледных, К2Тех: Строить ЦОД «с запасом» — не значит закупать мощности впрок

Назад к списку

Горячая линия
Предпродажное обслуживание: 13241121312
Послепродажное обслуживание: 010-84932407
WeChat
WeChat такой же, как: 13241121312
QR-код WeChat
Наверх