GPU服务器租用环境检测与启动
本文说明GPU服务器租用后如何核对GPU与Docker访问,并用vLLM在Linux和Python 3.10至3.13环境中启动、验证模型接口。
完成下面的环境检测与启动后,你会在 GPU服务器租用环境中确认 NVIDIA 驱动、验证 Docker 的 GPU 容器访问,并让 vLLM 启动 Qwen/Qwen2.5-1.5B-Instruct,最后查询 /v1/models。开始前需要一台可登录的 Linux GPU 实例和相应的运行环境;具体 GPU、驱动、容器组件及 Python 版本要求都在下文按官方文档核对。
准备条件:GPU服务器租用
根据阿里云「什么是 GPU 云服务器」说明,创建 ECS 实例时,应在企业级异构计算规格族、弹性裸金属服务器或超级计算集群(SCC)规格族下选择 GPU 规格;其计费与 ECS 一致,计算资源、镜像、块存储、公网带宽和快照等资源涉及计费,并支持包年包月、按量付费、抢占式实例和预留实例券等模式。
根据vLLM 的 GPU 安装文档,运行环境应为 Linux、Python 3.10 至 3.13,NVIDIA GPU 的 compute capability 应为 7.5 或更高;文档建议在全新环境安装,若 CUDA 版本不同或需要沿用已有 PyTorch,则应源码构建,并准备 GCC/G++ 11.3 或更高版本。
如果还要检查容器访问,Docker 的「GPU 访问」文档要求先安装 NVIDIA 驱动并重启系统,再安装 NVIDIA Container Toolkit;启动容器时通过 --gpus 暴露 GPU。
操作步骤
1. 检查主机 GPU 驱动
按阿里云 Linux GPU 驱动安装文档提供的方法检查 Tesla 驱动:
nvidia-smi
该命令用于查看驱动安装结果,能够显示 NVIDIA 驱动和 GPU 信息后再继续。
2. 配置 Docker 的 NVIDIA runtime
按NVIDIA Container Toolkit 安装指南配置 Docker:
sudo nvidia-ctk runtime configure --runtime=docker
该命令会更新主机上的 /etc/docker/daemon.json,使 Docker 使用 NVIDIA Container Runtime。
sudo systemctl restart docker
该命令重启 Docker daemon,让刚写入的运行时配置生效。
3. 检查容器中的 GPU
按前述 Docker 文档,将全部 GPU 暴露给临时 Ubuntu 容器:
docker run -it --rm --gpus all ubuntu nvidia-smi
该命令通过 --gpus all 暴露全部 GPU,容器内能够显示 GPU 信息即通过这项检查。
4. 创建 Python 环境
以下第 4 至第 7 步采用vLLM 快速入门文档给出的安装与启动方式,先创建 Python 3.12 虚拟环境:
uv venv --python 3.12 --seed
该命令创建新的虚拟环境,并按文档设置生成的基础包。
5. 激活虚拟环境
source .venv/bin/activate
该命令将当前 Shell 切换到刚创建的 .venv 环境。
6. 安装 vLLM
uv pip install vllm --torch-backend=auto
该命令安装 vLLM,并由 --torch-backend=auto 根据已安装的 CUDA 驱动选择相应的 PyTorch 后端。
7. 启动模型服务
vllm serve Qwen/Qwen2.5-1.5B-Instruct
该命令启动示例模型,服务默认监听 http://localhost:8000。
怎么确认成功
先检查主机上的 nvidia-smi:能够显示 Tesla 驱动和 GPU,说明主机侧驱动可用。随后运行容器检查命令;如果容器中的 nvidia-smi 也能显示 GPU,说明 Docker 的 GPU 访问链路已经就绪。
vLLM 启动后,另开终端执行:
curl http://localhost:8000/v1/models
文档把该 GET 请求作为列出已启动模型的检查入口;返回包含 Qwen/Qwen2.5-1.5B-Instruct 的模型列表,即表示服务接口可以响应。
常见出错点
nvidia-smi 不可用
命令不存在或没有显示可用设备时,先回到步骤 1,按阿里云文档核对与当前操作系统和实例镜像匹配的驱动,不要继续安装容器组件或 vLLM。
容器仍然看不到 GPU
先确认主机侧 nvidia-smi 已通过,再核对 NVIDIA Container Toolkit 是否安装;随后重新执行步骤 2 中的 nvidia-ctk 配置和 Docker daemon 重启命令。
vLLM 安装发生依赖冲突
不要在混有旧版 PyTorch 或不同 CUDA 版本的环境中直接修复。优先按步骤 4 新建环境;如果必须沿用已有 PyTorch 或不同 CUDA 版本,则回到前述 GPU 安装文档,按源码构建要求准备 GCC/G++ 11.3 或更高版本。
远程客户端无法连接
vLLM 默认地址是 http://localhost:8000,它不是供其他机器直接访问的地址。需要调整监听地址时,应按快速入门文档使用 --host 和 --port,再重新检查服务入口。
这些步骤依据正文链接的官方文档整理,未在本网站自有机器上运行,执行前请按当前版本核对。