Вернуться к экспертизе

GPU-сервер начинается с электропитания и охлаждения

Современный GPU-узел может физически войти в стойку и при этом оказаться несовместимым с площадкой. Ограничением становятся доступная мощность на вводах, отвод тепла, масса, кабельные трассы и сеть. Поэтому обследование помещения должно предшествовать финальной спецификации сервера.

К
Команда ИИ и инфраструктуры ВирТЭКАрхитектура вычислительных платформ

Считайте весь путь электропитания

Начинайте с максимальной длительной мощности узла, а не со среднего потребления в презентации. Проверьте вводы здания, UPS, распределительные щиты, автоматы, сечение кабелей, разъёмы и PDU. Для резервирования A/B каждая ветвь должна выдержать нагрузку после отказа второй, иначе два кабеля создают только видимость отказоустойчивости.

В расчёт включают соседнее оборудование, пусковые режимы, рост и допустимую загрузку компонентов. Одновременно проверяют заземление, селективность защиты и процедуру аварийного отключения.

Переведите киловатты в тепло

Почти вся потреблённая электрическая мощность превращается в тепло. Обычная схема холодного и горячего коридора может не справиться с плотной GPU-стойкой даже при достаточной общей мощности кондиционеров. Важны температура именно на входе серверов, объём и давление воздуха, заглушки, изоляция потоков и отсутствие рециркуляции.

Для высокой плотности рассматривают внутрирядное или жидкостное охлаждение. Тогда дополнительно проверяют CDU, параметры теплоносителя, резервирование насосов, качество воды, соединения, датчики протечки и ответственность между ИТ и эксплуатацией здания.

Проверьте механику и обслуживание

Зафиксируйте полезную глубину стойки, допустимую массу, нагрузку на пол, положение направляющих и путь доставки. Сервисный зазор должен позволять заменить блок питания, сетевой модуль или кабель без демонтажа соседнего оборудования. Тяжёлые узлы требуют подходящих подъёмных средств и безопасного регламента монтажа.

Направление воздушного потока коммутаторов и серверов должно совпадать. Кабели не должны перекрывать выпуск воздуха и мешать выдвижению узла.

Проектируйте сеть и хранение вместе с вычислениями

GPU простаивает, если данные не поступают вовремя. Разделите производственную сеть, управление, хранилище и межузловой обмен; рассчитайте порты, оптику, кабели и подписки коммутаторов. Для обучения и RAG оцените не только объём СХД, но и последовательное чтение, метаданные, параллелизм и окно резервного копирования.

Проведите приёмку под нагрузкой

До передачи в эксплуатацию нагрузите CPU, GPU, память, сеть и диски одновременно. Измеряйте мощность по ветвям, температуру на входе и выходе, частоты ускорителей, ошибки интерфейсов и работу охлаждения при отказе одного компонента.

Итогом обследования должна быть не общая фраза «мощности хватает», а карта стойки, бюджет по A/B, тепловая модель, схема подключений, пороги мониторинга и перечень работ до поставки. Так характеристики GPU превращаются в устойчивый сервис, а не в источник внеплановой реконструкции.

Нужна архитектура
под вашу задачу?

Разберём исходные данные, риски и ограничения, затем предложим обоснованный вариант решения.

Обсудить с инженером