DeepSeek本地部署模型切换配置
本地部署deepseek可在 Modelfile 中修改 FROM 创建不同 Ollama 本地别名,再用 ollama run 完成切换与调用。
完成本文后,你会在 Linux 上用 Ollama 创建本地模型:基础配置来自 deepseek-r1:1.5b,切换配置改用 deepseek-r1:32b,随后调用对应的本地别名。开始前需要一台可安装 Ollama 的 Linux 机器;本文引用的库页没有给出覆盖所有机器的统一硬件门槛,应先看文件大小,再核对当前库页和所用 GPU 配置。
准备条件:本地部署deepseek先选基础模型
根据 Ollama 的 DeepSeek-R1 库页,默认名称 deepseek-r1 的 latest 对应 8b 标签。可在 FROM 中使用的常见标签如下:
| 基础模型标签 | 文件大小 | 上下文 |
|---|---|---|
deepseek-r1:1.5b |
1.1GB | 128K |
deepseek-r1:7b |
4.7GB | 128K |
deepseek-r1:8b |
5.2GB | 128K |
deepseek-r1:14b |
9.0GB | 128K |
deepseek-r1:32b |
20GB | 128K |
deepseek-r1:70b |
43GB | 128K |
文件大小不能直接等同于显存或内存需求,租用 GPU 时还要核对实际配置。
Ollama 的 Linux 文档提供了一行安装命令:
curl -fsSL https://ollama.com/install.sh | sh
该命令把官方 install.sh 交给 sh 执行,已经能运行 ollama 的机器无需重复安装。
Linux 使用 NVIDIA GPU 时,可以先检查驱动:
nvidia-smi
正确结果是命令打印 GPU 信息;同一文档也使用下面的命令检查 Ollama:
ollama -v
能够返回版本信息,说明 CLI 可以使用。
操作步骤
1. 编写基础 Modelfile
Ollama 的 Modelfile 参考说明,FROM 是唯一必需的指令,用于定义基础模型;PARAMETER 用来设置运行参数。在当前目录保存名为 Modelfile 的文件:
FROM deepseek-r1:1.5b
PARAMETER temperature 0.6
PARAMETER num_ctx 4096
这份配置选择 1.5b 基础模型,把 temperature 设为 0.6,并采用参考文档中的 num_ctx 4096 示例值;该示例值不是硬件门槛。
2. 创建并调用本地模型
按照 Ollama 的 CLI 文档,在 Modelfile 所在目录执行:
ollama create my-model-1-5b
该命令根据当前 Modelfile 创建名为 my-model-1-5b 的本地模型。
ollama run my-model-1-5b
该命令以刚创建的本地名称调用模型,后续指令应作为用户提示输入。
3. 修改基础模型并切换
将 FROM 行替换为下面的内容,其他运行参数保持不变:
FROM deepseek-r1:32b
PARAMETER temperature 0.6
PARAMETER num_ctx 4096
新的基础模型变为 deepseek-r1:32b,模型切换关系由 FROM 中的标签决定。
使用另一个本地别名保存切换后的配置:
ollama create my-model-32b
该命令根据修改后的 Modelfile 创建 my-model-32b。
ollama run my-model-32b
调用这个名称即可从 my-model-1-5b 切换到基于 32b 标签的本地模型;两个 my-model-* 名称都是你定义的本地别名,不是官方基础模型标签。
怎么确认成功
先调用较小标签对应的本地模型:
ollama run my-model-1-5b
正确结果是接受用户提示并返回模型生成的内容,而不是固定文案。
再调用切换后的本地模型:
ollama run my-model-32b
同样能够返回生成内容,说明修改 FROM、重新创建和按新别名调用这条路径已经连通。
常见出错点
温度、SYSTEM 与思考格式不符合建议
DeepSeek-R1 官方使用说明建议把 temperature 设在 0.5-0.7,并推荐 0.6,以减少 endless repetitions 或 incoherent outputs。同一说明要求不要添加 system prompt,而应把所有指令放入 user prompt;它还记录了 R1 系列在部分问题中绕过思考模式的情况,官方建议要求回答以 think 标签开始。因此遇到重复、语句不连贯或跳过思考时,应先检查 temperature 0.6、移除 SYSTEM,再调整用户提示。
导入 GGUF 后期待 Ollama 自动量化
Ollama 的模型导入文档说明,Ollama 导入 GGUF 时不会自动量化模型。需要先使用 llama-quantize 等 GGUF 工具完成量化;FROM 可以指向 GGUF 的绝对路径,也可以使用相对于 Modelfile 的路径。
本文步骤依据正文所链接的官方文档整理,未在本站自有机器上运行,执行前请按当前版本复核。