计算完整供电路径
使用节点最大持续功率,而不是宣传材料中的平均值。检查建筑输入、UPS、配电柜、断路器、电缆、连接器和 PDU。A/B 冗余要求任一支路在另一支路故障后独立承载全部负载,同时计入邻近设备、增长余量、接地和紧急断电。
将千瓦转换为热量
几乎所有电功率最终都变成热量。即使机房总制冷量足够,传统冷热通道也可能无法支持高密度 GPU 机柜。需要测量服务器进风温度、风量、压力、盲板和回流。采用行级或液冷时,还要验证 CDU、冷却液、泵冗余、连接、漏水监测和运维责任。
检查结构与维护空间
确认机柜有效深度、重量限制、楼板承重、导轨位置和运输路径。维护空间应允许更换电源、网络和冷却部件而不影响相邻设备。交换机与服务器风向必须一致,线缆不能堵塞排风或妨碍设备抽出。
同时设计网络和存储
数据无法及时到达时,GPU 只能等待。应分离业务、管理、存储和集群网络,规划端口、光模块、线缆和交换机超售比。训练与 RAG 还要评估顺序吞吐、元数据、并发和备份窗口。
在组合负载下验收
同时压测 CPU、GPU、内存、网络和磁盘,记录每路功率、进出风温度、加速器频率、接口错误和单组件故障后的制冷表现。最终成果应是机柜图、A/B 功率预算、热模型、连接方案、监控阈值和施工清单。

