本地部署大模型环境检查清单

这份本地部署大模型环境检查清单依据官方文档,明确 vLLM 需要 Linux 与 Python 3.10 至 3.13,并核对 Ollama 的系统、驱动、磁盘和模型目录。

完成这份本地部署大模型环境检查后,你会得到 Ollama 与 vLLM 的可执行 Linux 部署路径,并能定位问题落在系统、驱动、磁盘、模型还是运行环境。开始前准备目标 Linux 环境、模型名称,以及后文列出的 GPU、Python、磁盘目录和容器组件;本文一次只演示一条运行路线,避免把宿主机与容器命令混在一起。

本地部署大模型前的准备条件

系统、驱动和 GPU

按 vLLM 的 Quickstart,vLLM 的基础环境是 Linux 与 Python 3.10 至 3.13。文档使用 uv 创建 Python 3.12 虚拟环境,--torch-backend=auto 会根据已安装的 CUDA driver version 选择 PyTorch index;服务默认监听 http://localhost:8000,一个服务进程当前承载一个模型。

按 vLLM 的 GPU 安装文档,NVIDIA GPU 的 compute capability 需要达到 7.5 或更高,预编译包包含 C++ 与 CUDA(12.9)二进制;从源码构建则需要 GCC/G++ 11.3 或更高。如果 CUDA version 不同或已经安装 PyTorch,vLLM 的 NVIDIA CUDA 安装说明要求从源码构建,并建议使用全新的环境。

磁盘与模型目录

按 Ollama 的 FAQ 核对模型落盘位置:macOS 默认使用 ~/.ollama/models,Linux 使用 /usr/share/ollama/.ollama/models,Windows 使用 C:\Users\%username%\.ollama\models;Linux 标准安装如果改用自定义模型目录,ollama 用户还必须拥有该目录的读写权限。这些路径不是模型容量承诺,具体模型所需空间应以其当前说明为准。

操作步骤

  1. 检查 NVIDIA 驱动并安装 Ollama。 按 Ollama 的 Linux 文档,先用 nvidia-smi 检查驱动,再运行官方一行安装命令;采用手动启动方式时,用 ollama serve 启动服务。

bash nvidia-smi

该命令用于读取驱动状态,正确结果应显示 GPU 详情。

bash curl -fsSL https://ollama.com/install.sh | sh

该命令把 Ollama 官方 Linux 安装脚本交给 sh 执行。

bash ollama serve

该命令启动 Ollama 服务进程。

  1. 按需改用 Docker 运行 Ollama。 Ollama 的 Docker 文档要求 NVIDIA GPU 路线先准备 NVIDIA Container Toolkit,再用 nvidia-ctk 配置 Docker 并重启 Docker daemon;运行容器时使用 --gpus=all。

bash sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker

第一条命令配置 NVIDIA runtime,第二条命令重启 Docker daemon。

bash docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

该命令把 GPU 交给容器,将命名卷挂载到 /root/.ollama,并发布 11434 端口。

  1. 创建 vLLM 环境并启动模型服务。 使用 Quickstart 给出的隔离环境与安装顺序,不要复用存在 PyTorch 的旧环境。

bash uv venv --python 3.12 --seed

该命令创建使用 Python 3.12 的 .venv 虚拟环境。

bash source .venv/bin/activate

该命令在当前 shell 中激活 .venv。

bash uv pip install vllm --torch-backend=auto

该命令安装 vLLM,并让 uv 根据已安装的 CUDA driver version 选择 PyTorch index。

bash vllm serve Qwen/Qwen2.5-1.5B-Instruct

该命令启动 Qwen/Qwen2.5-1.5B-Instruct 的 vLLM 服务,默认地址为 http://localhost:8000。

怎么确认成功

Ollama 服务

在另一个终端运行:

ollama -v

Ollama 的 Linux 文档用这条命令确认服务正在运行;文档没有规定固定版本文本,不要把某个示例版本号当成唯一成功标准。

Docker 中的模型

容器启动后运行:

docker exec -it ollama ollama run llama3.2

官方 Docker 文档用这条命令在运行中的容器里启动 llama3.2;命令进入模型运行过程即可,不要自行编造一段固定输出作为判断标准。

vLLM 服务

另开终端请求模型列表:

curl http://localhost:8000/v1/models

正确结果是 /v1/models 返回模型列表;如果没有响应,应先检查 vllm serve 所在终端是否仍正常运行。

常见出错点

  • GPU 条件看错了。 vLLM 的 compute capability 门槛与 Ollama 不同,不能用一张卡通过 Ollama 检查,就推断它也满足 vLLM;先按各自文档核对。
  • 自定义模型目录无法写入。 Linux 标准安装下,ollama 用户需要自定义目录的读写权限;应在下载模型前处理该目录权限。
  • vLLM 安装与旧环境冲突。 不同 CUDA version 或已有 PyTorch 安装需要从源码构建;一般情况先使用全新环境,源码构建还要核对 GCC/G++ 11.3 或更高。
  • Ollama 更新方式混用。 使用一键脚本时,文档方式是重新运行安装脚本;只有手动安装覆盖旧版本时,才应先清理 /usr/lib/ollama 旧库。
  • 宿主机有 GPU,容器却没有。 检查 NVIDIA 驱动、NVIDIA Container Toolkit、nvidia-ctk runtime 配置和 Docker daemon 重启是否都已完成,然后再使用 --gpus=all。

本文步骤按正文所链接的官方文档整理,未在本站机器上运行或测量;执行前请按当前版本再次核对命令、路径和硬件要求。

资料来源