Ollama模型创建与参数配置

用 Modelfile 的唯一必需指令 FROM 选定基础模型,通过 PARAMETER 与 SYSTEM 配置模型,并用 ollama run 验证模型可运行。

完成本文后,你会得到一个由 Modelfile 定义基础模型、运行参数和系统消息的自定义模型,并完成创建、配置查看和交互运行验证。开始前需要已安装 ollama、有一个可用的基础模型或本地模型文件,以及能编辑 Modelfile 的文本工具;整个流程不需要密码或 API key。

准备条件

先决定基础模型的来源。本例使用文档示例中的 llama3.2;如果你要换成其他模型,应确认当前环境能够取得该模型,不要直接照抄一个本机不存在的名称。

在计划执行创建命令的工作目录中,把配置文件保存为 Modelfile。如果改用本地模型,还要准备好对应文件,并确认配置中的路径与实际文件名、目录结构一致。本文不展开模型下载和硬件选择,这两部分应按当前平台的官方文档另行核对。

操作步骤

  1. 写入基础模型和运行参数

创建一个名为 Modelfile 的文件,写入以下内容:

```dockerfile FROM llama3.2

PARAMETER temperature 1 PARAMETER num_ctx 4096

SYSTEM """ You are a helpful assistant. """ ```

FROM 是唯一必需的指令并定义基础模型,PARAMETER 设置运行参数,SYSTEM 设置系统消息;本例显式设置 temperature 1 和 num_ctx 4096,其中 temperature 的文档默认值为 0.8,数值越高越有创造性、越低越连贯,而本地 GGUF 的 FROM 路径须为绝对路径或相对 Modelfile 的路径,详见 Ollama 的 Modelfile 参考文档。

  1. 创建自定义模型

确认文件已经保存后,执行:

shell ollama create my-model

该命令依据 Modelfile 创建名为 my-model 的定制模型;如果还要核对服务端的模型条目,请以 Ollama 的 CLI 参考文档 当前列出的查询命令和输出格式为准,不要沿用未经确认的旧参数。

  1. 查看并复核配置

重新打开 Modelfile,逐项查看 FROM 是否指向预期的基础模型,temperature 和 num_ctx 是否为预期值,以及 SYSTEM 中是否保留了正确的系统消息。这里查看的是配置源,能够排除拼写、路径和参数被误改的问题;模型能否实际调用,还要通过下一步运行确认。

怎么确认成功:用 ollama 运行并查看响应

先运行刚创建的模型:

ollama run my-model

该命令运行 my-model 并进入可接收命令的交互环境;Ollama 的常见问题文档 说明默认上下文窗口为 4096 tokens,可由 OLLAMA_CONTEXT_LENGTH 覆盖,并可在 ollama run 中使用 /set parameter num_ctx 设置当前会话的值。

进入会话后输入:

/set parameter num_ctx 4096

这条命令把当前运行会话的 num_ctx 设置为 4096;如果该命令未被当作参数错误拒绝,你就完成了一次会话参数设置检查。

随后输入一条自己能判断答案是否合理的问题。成功标志不是某段固定回答,而是模型能够被加载、/set parameter num_ctx 4096 没有参数错误,并且交互环境能够返回文本。官方说明没有规定固定回答文案,因此不要把示例答案当作唯一通过标准。

常见出错点

把 GGUF 导入当成自动量化

Ollama 在导入 GGUF 时不会自动执行量化,应先使用 llama-quantize 等 GGUF 工具准备并量化权重;单文件 GGUF 的 FROM 指向文件路径,Safetensors 则指向权重目录,如果 Modelfile 与权重位于同一目录,可以使用 FROM .,这些区别见 Ollama 的模型导入文档。

调大 num_ctx 后忽略显存需求

上下文长度越大,运行模型所需的内存和 VRAM 越多;如果调整后出现内存不足,应先检查可用 VRAM,再把当前 num_ctx 降到资源能够承载的值,而不要反复重新创建同一个模型,具体要求见 Ollama 的上下文长度文档。

这些步骤依据正文所链接的官方文档整理,未在本站自有机器上运行;执行前请按当前版本复核命令、路径和参数。

资料来源