本地部署大模型环境检查清单
这份本地部署大模型环境检查清单依据官方文档,明确 vLLM 需要 Linux 与 Python 3.10 至 3.13,并核对 Ollama 的系统、驱动、磁盘和模型目录。
完成这份本地部署大模型环境检查后,你会得到 Ollama 与 vLLM 的可执行 Linux 部署路径,并能定位问题落在系统、驱动、磁盘、模型还是运行环境。开始前准备目标 Linux 环境、模型名称,以及后文列出的 GPU、Python、磁盘目录和容器组件;本文一次只演示一条运行路线,避免把宿主机与容器命令混在一起。
本地部署大模型前的准备条件
系统、驱动和 GPU
按 vLLM 的 Quickstart,vLLM 的基础环境是 Linux 与 Python 3.10 至 3.13。文档使用 uv 创建 Python 3.12 虚拟环境,--torch-backend=auto 会根据已安装的 CUDA driver version 选择 PyTorch index;服务默认监听 http://localhost:8000,一个服务进程当前承载一个模型。
按 vLLM 的 GPU 安装文档,NVIDIA GPU 的 compute capability 需要达到 7.5 或更高,预编译包包含 C++ 与 CUDA(12.9)二进制;从源码构建则需要 GCC/G++ 11.3 或更高。如果 CUDA version 不同或已经安装 PyTorch,vLLM 的 NVIDIA CUDA 安装说明要求从源码构建,并建议使用全新的环境。
磁盘与模型目录
按 Ollama 的 FAQ 核对模型落盘位置:macOS 默认使用 ~/.ollama/models,Linux 使用 /usr/share/ollama/.ollama/models,Windows 使用 C:\Users\%username%\.ollama\models;Linux 标准安装如果改用自定义模型目录,ollama 用户还必须拥有该目录的读写权限。这些路径不是模型容量承诺,具体模型所需空间应以其当前说明为准。
操作步骤
- 检查 NVIDIA 驱动并安装 Ollama。 按 Ollama 的 Linux 文档,先用
nvidia-smi检查驱动,再运行官方一行安装命令;采用手动启动方式时,用ollama serve启动服务。
bash
nvidia-smi
该命令用于读取驱动状态,正确结果应显示 GPU 详情。
bash
curl -fsSL https://ollama.com/install.sh | sh
该命令把 Ollama 官方 Linux 安装脚本交给 sh 执行。
bash
ollama serve
该命令启动 Ollama 服务进程。
- 按需改用 Docker 运行 Ollama。 Ollama 的 Docker 文档要求 NVIDIA GPU 路线先准备 NVIDIA Container Toolkit,再用
nvidia-ctk配置 Docker 并重启 Docker daemon;运行容器时使用--gpus=all。
bash
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
第一条命令配置 NVIDIA runtime,第二条命令重启 Docker daemon。
bash
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
该命令把 GPU 交给容器,将命名卷挂载到 /root/.ollama,并发布 11434 端口。
- 创建 vLLM 环境并启动模型服务。 使用 Quickstart 给出的隔离环境与安装顺序,不要复用存在 PyTorch 的旧环境。
bash
uv venv --python 3.12 --seed
该命令创建使用 Python 3.12 的 .venv 虚拟环境。
bash
source .venv/bin/activate
该命令在当前 shell 中激活 .venv。
bash
uv pip install vllm --torch-backend=auto
该命令安装 vLLM,并让 uv 根据已安装的 CUDA driver version 选择 PyTorch index。
bash
vllm serve Qwen/Qwen2.5-1.5B-Instruct
该命令启动 Qwen/Qwen2.5-1.5B-Instruct 的 vLLM 服务,默认地址为 http://localhost:8000。
怎么确认成功
Ollama 服务
在另一个终端运行:
ollama -v
Ollama 的 Linux 文档用这条命令确认服务正在运行;文档没有规定固定版本文本,不要把某个示例版本号当成唯一成功标准。
Docker 中的模型
容器启动后运行:
docker exec -it ollama ollama run llama3.2
官方 Docker 文档用这条命令在运行中的容器里启动 llama3.2;命令进入模型运行过程即可,不要自行编造一段固定输出作为判断标准。
vLLM 服务
另开终端请求模型列表:
curl http://localhost:8000/v1/models
正确结果是 /v1/models 返回模型列表;如果没有响应,应先检查 vllm serve 所在终端是否仍正常运行。
常见出错点
- GPU 条件看错了。 vLLM 的 compute capability 门槛与 Ollama 不同,不能用一张卡通过 Ollama 检查,就推断它也满足 vLLM;先按各自文档核对。
- 自定义模型目录无法写入。 Linux 标准安装下,
ollama用户需要自定义目录的读写权限;应在下载模型前处理该目录权限。 - vLLM 安装与旧环境冲突。 不同 CUDA version 或已有 PyTorch 安装需要从源码构建;一般情况先使用全新环境,源码构建还要核对 GCC/G++ 11.3 或更高。
- Ollama 更新方式混用。 使用一键脚本时,文档方式是重新运行安装脚本;只有手动安装覆盖旧版本时,才应先清理
/usr/lib/ollama旧库。 - 宿主机有 GPU,容器却没有。 检查 NVIDIA 驱动、NVIDIA Container Toolkit、
nvidia-ctkruntime 配置和 Docker daemon 重启是否都已完成,然后再使用--gpus=all。
本文步骤按正文所链接的官方文档整理,未在本站机器上运行或测量;执行前请按当前版本再次核对命令、路径和硬件要求。