vLLM安装与首次模型启动
本文按官方文档讲解 vllm 的依赖检查、Python 3.12 环境安装和首次模型启动,并用 /v1/models 验证服务是否响应。
完成本文后,你会在 Linux 的 Python 3.12 虚拟环境中安装好 vllm,并让 Qwen/Qwen2.5-1.5B-Instruct 在 http://localhost:8000 提供可查询的模型服务。开始前需要 vLLM 快速开始文档 列出的 Linux、Python 3.10 至 3.13,以及满足下文 GPU 条件的 NVIDIA GPU;Windows 不受原生支持,应改用 vLLM 的 WSL 安装说明 中的兼容 Linux 发行版。
准备条件
先准备独立的工作目录和 shell,不要把旧项目的依赖混入首次安装。以下假定 uv 已经可用;如果尚未准备好它,应先按照前引官方快速开始文档的环境准备部分,根据当前系统选择安装步骤。
按照 vLLM GPU 安装文档,NVIDIA GPU 的 compute capability 需要达到 7.5 或更高。预编译 vLLM 包包含预编译的 C++ 和 CUDA 12.9 binaries;B200、GB200 至少需要 CUDA 12.8,因此对应的 PyTorch wheels 也不能低于该版本。若需要从源码构建,编译器必须是 GCC/G++ 11.3 或更新版本。
操作步骤:用 vllm 命令完成安装与启动
下面的环境创建、安装、启动、默认监听地址、单模型限制和验证请求均按 vLLM 快速开始文档 编排。
- 创建 Python 3.12 虚拟环境。
uv venv --python 3.12 --seed
这条命令按官方推荐路径创建 Python 3.12 虚拟环境。
- 激活新环境。
source .venv/bin/activate
这条命令在当前 shell 中激活刚创建的虚拟环境。
- 安装 vLLM。
uv pip install vllm --torch-backend=auto
这条命令安装 vLLM;--torch-backend=auto 会检查已安装的 CUDA driver version 并选择 PyTorch index,文档也给出了等价设置 UV_TORCH_BACKEND=auto。
- 启动模型服务。
vllm serve Qwen/Qwen2.5-1.5B-Instruct
这条命令以指定模型名启动服务,默认监听 http://localhost:8000,可使用 --host 和 --port 修改地址,而当前一个服务进程一次只承载一个模型。
怎么确认成功
保持服务进程运行,在另一个终端中发送模型列表请求:
curl http://localhost:8000/v1/models
按照官方定义,正确结果是 GET /v1/models 能够返回模型列表;如果你修改过监听地址,应把命令中的端口和主机替换为实际值。
常见出错点
原生 Windows 无法安装
出现平台不支持错误时,直接改用 WSL 中的兼容 Linux 发行版;vLLM 当前不提供原生 Windows 支持,在 PowerShell 中继续执行 Linux 安装命令不能替代这条路径。
安装路径转向源码构建或 nightly 安装
如果当前 CUDA version 与官方安装组合不同,或者环境中已经存在 PyTorch,NVIDIA CUDA 安装说明 要求转为源码构建。nightly wheels 也不能用 pip 安装,因为 pip 会合并 --extra-index-url 与默认索引并只选择最新版本,官方因此要求使用 uv;源码构建前还要确认 GCC/G++ 达到前述版本要求。
聊天请求提示无法处理
在线服务文档 说明,服务默认使用 tokenizer 中保存的 chat template;模型没有该模板时,服务器无法处理聊天请求。此时通过 --chat-template 提供模板文件路径或模板字符串。
显存参数没有按预期生效
根据 vllm serve 命令参考,--gpu-memory-utilization 的取值范围是 0 到 1,默认值为 0.92,而且是单个实例的限制。设置 --kv-cache-memory-bytes 后,它会覆盖 gpu_memory_utilization 的作用,因此不要把两个参数当成彼此独立的显存上限。
这些步骤依据正文所链接的官方文档整理,未在本站自有机器上运行或测量;执行前请按当前版本核对。