GPU 服务器怎么选:从模型规模反推显存的最低配置
买 GPU 服务器前先用模型规模与精度反推显存下限,再用 NVIDIA 官方算力档位表筛选架构,并用 vLLM 官方引擎参数自检显存是否够用,给出租卡与买卡的决策边界。
从模型规模反推显存下限
在花钱之前,决策顺序应是:先固定模型规模、权重精度和量化格式,估算权重占用;再把 KV Cache、运行时工作区与计划并发纳入显存预算;最后才用算力档位筛选 GPU 架构。
可以用下面的框架核算:
显存需求 ≈ 权重占用 + KV Cache + 运行时工作区
量化格式可能改变权重占用,但模型名称不能替代精度、量化格式和推理引擎版本。vLLM Engine Arguments 文档给出的边界很明确:13B 模型使用 BF16 权重时,至少需要 26GB 显存。因此,单张 24GB GPU 不满足这个官方示例的权重下限;加入 KV Cache 和运行时开销后的实际需求还可能更高。这个例子不能直接外推到所有 13B 量化模型。
再用算力档位筛选架构
NVIDIA CUDA GPU 官方对照表将 compute capability 定义为不同 NVIDIA GPU 架构的硬件特性和受支持指令集。官方列出的对应关系是:
9.0:NVIDIAGH200 / H200 / H1008.9:NVIDIAL4 / L40 / L40S8.6:NVIDIAA40 / A10 / A16 / A28.0:NVIDIAA100 / A307.5:NVIDIAT4
这里需要区分两种“能否加载”:显存容量决定权重和运行时数据是否装得下,compute capability 则用于检查引擎和量化内核所需的功能、指令集是否得到支持。如果目标引擎的官方支持范围不覆盖该架构,单纯增加显存也不能解决兼容问题。
因此,compute capability 是软件兼容性门槛,不是显存容量表,也不是跨架构性能排名。CUDA 对照表本身没有给出各量化格式与引擎的完整支持关系,具体格式仍应核对引擎官方构建要求,并通过目标版本的实际启动结果验证。更高档位也不代表显存一定更充足。
高配卡贵在哪些规格项
NVIDIA H100 官方产品页列出的 GPU Memory 为 80GB / 94GB,显存带宽为 3.35TB/s / 3.9TB/s,FP8 Tensor Core 算力为 3,958 teraFLOPS / 3,341 teraFLOPS,最大 TDP 标为 Up to 700W / 350–400W。
这些数字对应不同约束。容量决定模型能否装入,带宽关系到数据移动,FP8 Tensor Core 算力只在实际软件栈使用 FP8 时才具有直接评估意义,TDP 则关系到供电与散热设计,不能当作速度指标。
官方规格本身不说明交易价格,也就不能证明某张卡具有更高的性价比。所谓“高配”溢价应拆成具体规格项核对:如果瓶颈是装不下,重点看容量;如果瓶颈是数据搬运,重点看带宽;如果工作负载确实采用 FP8,再看 Tensor Core 算力;如果部署场地的供电与散热受限,则必须同时核对 TDP。
用 vLLM 官方参数完成显存自检
购买或租用之前,可以先用 nvidia-smi 核对物理 GPU 型号和总显存,再用 vLLM 官方参数与启动日志验证模型是否真正完成加载。
--cpu-offload-gb的官方示例是:一张24GBGPU 设置为10后,可以概念上视为34GB,从而加载至少需要26GB的13B BF16权重。但文档同时强调,这依赖高速 CPU 与 GPU 互连。它是虚拟扩容,不是物理显存增加,不能据此把24GB卡在采购单中写成34GB卡。--device-memory-utilization是当前 vLLM 实例的逐实例限制,只作用于当前实例。它用于约束实例可使用的显存范围,不会扩展物理显存。--kv-cache-memory-bytes在不是None时,会忽略gpu_memory_utilization。两者是覆盖关系,不能把显式设置的 KV Cache 显存与利用率限制简单相加。
完成参数核对后,应查看 vLLM 启动日志中的模型加载、显存统计、KV Cache 分配和 OOM 信息。nvidia-smi 只能证明物理卡是什么、显存有多大;启动日志才用于确认目标模型、量化格式和引擎在当前配置下走到了哪一步。调整参数后也应重新验证,而不是沿用旧日志。
显存不足时按官方指南处理
vLLM Optimization and Tuning 文档对 OOM 的直接提示是:“Running out of memory? Consult this guide on how to conserve memory.”
文档还提供 -O0、-O1、-O2、-O3 四个优化级别。可验证的处理顺序是:出现 OOM 后先查官方的显存节省指南,再核对当前参数与启动日志,然后依据该版本文档选择合适的优化级别并重新启动验证。优化级别的名称本身不能证明显存占用会逐级下降,也不能证明 -O3 一定适合当前模型。
如果参数和日志最终确认物理显存不足,再回到采购决策,重新比较更大的显存容量或满足目标引擎要求的 GPU 架构。
租卡与买卡的决策边界
官方规格无法推出某种场景“必须租”还是“必须买”,但可以根据需求的不确定性划分边界。模型、精度、量化和并发尚未通过目标卡验证,或者需求只持续较短时间、没有既有服务器与运维能力时,应先租卡完成验证,再决定是否采购。模型与业务负载已经稳定、目标架构和显存规格明确,并且能够根据当前报价评估长期总成本时,才进入买卡评估。
租卡验收时,云平台产品页上的型号名称不算完成确认。应运行 nvidia-smi 核对实际设备名和总显存,再与 NVIDIA 官方算力档位表对照;启动目标 vLLM 后,还要用启动日志确认模型和量化格式能够加载。若采购目标是 H100,仅看到产品族名称仍不够,设备身份和显存规格都应与目标配置一致。
最终采购单应记录模型规模、精度、量化格式、引擎版本、显存下限、compute capability、offload 设置及启动验证结果。价格与配额以云厂商当前页面为准,本文不报价,也不依据商品名称直接判断最低配置。