算力租赁GPU实例选型清单

这份算力租赁GPU实例选型清单从显存、实例规格族、地域、磁盘、网络和计费模式逐项核对,避免把单张 GPU 的标称参数直接等同于云端实例规格。

完成这份清单后,你能在创建 GPU 实例前确定规格族、地域与可用区、磁盘、网络和付费模式,并判断任务能否接受停机或中断。开始前需要准备模型运行所需的显存数据、预计时长、用户或数据所在区域,以及可接受的资源释放边界;可售规格、价格和配额仍以云厂商当前页面为准。算力租赁不能只看显卡型号,而要核对整台实例的资源与费用边界。

准备条件:算力租赁先做一张核对表

先记录模型名称、运行框架、预计峰值显存、任务时长和是否需要保存状态。GPU 标称参数只作为硬件基线:H100 官方产品规格页列出 SXM 为 80GB、H100 NVL 为 94GB,最大 TDP 分别为最高 700W 和 350–400W;H200 官方产品规格页列出 SXM 与 NVL 均为 141GB,最大 TDP 分别为最高 700W 和 600W。这些参数不代表任一云厂商当前一定提供对应实例规格。

核对项 创建前必须写明 官方文档给出的边界
GPU、实例、磁盘与网络 GPU 型号、vCPU、内存、规格族;镜像、块存储、公网带宽、快照 阿里云 GPU 云服务器说明称,创建 ECS 时可在企业级异构计算、弹性裸金属和 SCC 规格族下选择 GPU 规格;计算资源、镜像、块存储、公网带宽和快照等资源涉及计费。
Region 与 AZ 用户或数据所在地、法律要求、目标 Region 与 AZ AWS 区域与可用区文档建议选择靠近客户或满足法律要求的 Region;各 Region 相互隔离,资源不会自动跨 Region 复制。
计费与生命周期 付费模式、运行时长、停机方式、任务能否重试 不同模式的中断和停机边界不同,应继续核对所选实例的当前计费文档。

操作步骤

  1. 为每个候选实例建立一行,写入模型运行所需的峰值显存、预计时长、状态保存要求和目标 Region。不要用“显存更大的 GPU”代替具体规格。

  2. 打开云厂商的最终订单页,逐项核对 GPU 型号、vCPU、内存、规格族、AZ、块存储、公网带宽、镜像、快照和计费模式。若当前官方页面没有写明磁盘下限、规格映射或某项是否另计费,就先不要购买。

  3. 如果选择按量付费,把释放实例纳入运行流程。阿里云按量付费文档说明,实例从创建到释放按秒计量,4 vCPU 及以上实例不足 2 分钟时按 2 分钟计费。

  4. 如果计划在空闲时停机,先核对适用条件。阿里云节省停机模式文档限定其适用于按量付费实例(含抢占式实例)、专有网络且不含本地盘的实例。通过 API 停止实例时,参数组合为:

text StoppedMode=StopCharging

该组合用于让停止操作进入节省停机模式。

  1. 如果选择抢占式实例,只把可中断、可重试的任务纳入候选。阿里云抢占式实例计费文档说明,折扣只覆盖实例规格,不覆盖镜像、云盘、固定带宽公网和快照;用户出价也不是实际计费价格,实际按市场价格计算。

怎么确认成功

创建后先确认 GPU 驱动可见:

nvidia-smi

阿里云 Linux 手动安装 Tesla 驱动文档使用该命令查看 Tesla 驱动是否安装成功。

需要核对完整 GPU 信息时执行:

nvidia-smi -q

NVIDIA System Management Interface 文档说明,-q 用于显示 GPU 或 Unit 信息,不支持的数据会显示为 N/A。

使用抢占式实例时,还应在实例内查询中断信息:

http://100.100.100.200/latest/meta-data/instance/spot/termination-time

阿里云抢占式实例中断事件文档说明,该地址返回 404 表示实例可继续使用。

常见出错点

  • GPU 已创建但不能加速:GPU 实例本身不配备驱动。阿里云 Tesla 或 GRID 驱动安装说明称,Linux GPU 计算型实例创建时选择公共镜像并选中“安装 GPU 驱动”,可在首次启动时自动安装 Tesla 驱动;Windows 实例需要创建后手动安装。

  • 停机后仍扣费,或重启后公网地址变化:未启用节省停机模式时,停止的按量实例仍会按规则计费;启用后,vCPU、GPU 和内存不再计费,但云盘、EIP 等资源仍计费,依据见阿里云按量付费说明。节省停机还会释放计算资源,库存不足时可能无法启动,固定公网 IP 也会在重启后变化,详见节省停机模式文档。

  • 抢占式实例突然被回收:出价低于市场价格或库存不足都可能触发中断,实例将在 5 分钟后释放。什么是抢占式实例文档不建议把有状态、长时间运行或稳定性要求高的业务放在这类实例上。

  • AWS 实例启动失败:InsufficientInstanceCapacity 表示当前 On-Demand 容量不足;EC2 启动故障排查文档建议等待几分钟重试、不指定 AZ,或减少单次请求数量。InstanceLimitExceeded 则表示已达到该 Region 的实例启动上限,不能按容量不足处理。

  • 把 GeForce 规格直接用于商业托管:GeForce 软件许可条款第 2.8 条称该软件未获准用于数据中心部署,第 2.7 条限制未经明确授权的商业托管。选型时应单独核对软件许可和托管授权,不能只看硬件参数。

这些步骤依据正文所链接的官方文档整理,未在本站自有机器上运行;请按当前版本逐项复核。

资料来源