先定义负载
“运行 14B 模型”并不是完整需求。同一模型可能只服务一名工程师,也可能为几十名员工提供知识库问答。首先应明确使用场景、并发峰值、上下文长度、可接受的量化方式和响应时间。
显存是一项动态预算
模型权重、运行缓冲区和 KV 缓存会共同占用显存。上下文越长、并发会话越多,缓存需求越高。量化能够降低占用,但必须用企业自己的文档和问题验证质量。
CPU、内存与存储同样重要
CPU 负责分词、接口和周边服务;内存承载操作系统、容器、文档处理与向量检索;NVMe 影响模型加载和索引速度。生产系统还需要冗余与备份,而不只是单块高速磁盘。
检查拓扑和机房条件
多 GPU 系统必须核对 PCIe 通道、CPU 根节点、GPU 互联以及网卡和 NVMe 的位置。同时要验证电源、散热和机柜承载能力。
用试点完成选型
使用真实请求测量首 Token 时间、生成吞吐量、并发会话数、GPU 利用率和显存占用。试点能够把经验判断转化为可复核的容量模型。

