Ollama · 入门

Ollama 安装与运行第一个本地模型

在 macOS、Windows、Linux 上安装 Ollama,下载并运行一个本地模型,确认是否用上显卡,再用本机接口调用。每一步附官方文档链接。

这篇是怎么写的

下面的命令和要求都取自 Ollama 官方文档在 2026 年 10 月 1 日的内容,每一节后面有来源链接。本站还没有在自己的机器上把这篇从头跑一遍,所以文中不写速度、显存占用这类需要实测才能说的结论。官方文档更新后,以官方为准。

开始之前:先看三件事

  • 系统版本。macOS 需要 Sonoma(14)或更新;苹果 M 系列芯片支持 CPU 和 GPU,x86 的 Mac 只能用 CPU。Windows 需要 Windows 10 22H2 或更新,家庭版和专业版都可以。
  • 磁盘空间。Windows 上程序本身至少要 4GB;模型另算,官方的说法是模型可以有几十到几百 GB。
  • 显卡驱动。Windows 上用 NVIDIA 显卡需要 551.61 或更新的驱动。Ollama 支持 compute capability 5.0 及以上的 NVIDIA 显卡,驱动版本 550 及以上;compute capability 5.0 到 6.2 的老卡要 570 或更新的驱动。自己的卡在不在支持范围内,查官方的硬件支持表。

来源:docs.ollama.com/macos 来源:docs.ollama.com/windows 来源:docs.ollama.com/gpu

第一步:安装

Linux

官方给的安装命令是一行:

curl -fsSL https://ollama.com/install.sh | sh

装完后启动服务并查看状态:

sudo systemctl start ollama
sudo systemctl status ollama

用 NVIDIA 显卡的话,先确认驱动已经装好,下面这条命令应该能打印出显卡信息:

nvidia-smi

来源:docs.ollama.com/linux

macOS

从 ollama.com/download 下载,打开 ollama.dmg,把 Ollama 拖进「应用程序」文件夹。首次启动时,应用会检查 ollama 命令是否在 PATH 里;不在的话会请求权限,在 /usr/local/bin 建一个链接。

来源:docs.ollama.com/macos

Windows

从同一个下载页取安装程序。安装不需要管理员权限,默认装在用户目录下。装好后 Ollama 在后台运行,cmd、PowerShell 里都能直接用 ollama 命令。想装到别的盘,用这个参数启动安装程序:

OllamaSetup.exe /DIR="d:\some\location"

来源:docs.ollama.com/windows

第二步:确认装好了

ollama -v

能打印出版本号,说明命令行可用。Linux 上如果是手动安装、没有配成系统服务,需要先在另一个终端执行 ollama serve。

来源:docs.ollama.com/linux

第三步:下载并运行一个模型

ollama run 后面跟模型名,本机没有这个模型时会先下载。以 DeepSeek-R1 为例,Ollama 模型库页面给出的命令是:

ollama run deepseek-r1

不带标签时用的是 latest,在模型库页面上它对应 8b,下载体积 5.2GB。同一页列出的其他标签和下载体积:

标签下载体积命令
1.5b1.1GBollama run deepseek-r1:1.5b
7b4.7GBollama run deepseek-r1:7b
8b(latest)5.2GBollama run deepseek-r1:8b
14b9.0GBollama run deepseek-r1:14b
32b20GBollama run deepseek-r1:32b
70b43GBollama run deepseek-r1:70b
671b404GBollama run deepseek-r1:671b

表里是下载体积,不是运行时需要的显存或内存。自己的机器能跑到哪一档,要装上以后按下一步的方法看。该页写明模型权重采用 MIT 许可、支持商用,同时提示蒸馏版本派生自其他模型系列,各有原始许可;用于业务之前请自己读一遍许可说明。

来源:ollama.com/library/deepseek-r1

常用的几个管理命令:

ollama pull deepseek-r1:7b   # 只下载,不运行
ollama ls                    # 列出本机已有的模型
ollama ps                    # 列出正在运行的模型
ollama stop deepseek-r1:7b   # 停掉一个正在运行的模型
ollama rm deepseek-r1:7b     # 删除模型

来源:docs.ollama.com/cli

第四步:确认模型有没有用上显卡

模型运行时,另开一个终端执行:

ollama ps

输出里有一列 PROCESSOR。官方文档的示例是 100% GPU,表示模型完全加载在显卡上。如果这一列显示的是 CPU,或者 CPU 与 GPU 各占一部分,说明模型没有完全放进显存,这时可以换小一档的标签再试。

来源:docs.ollama.com/faq

第五步:用本机接口调用

Ollama 启动后在本机 http://localhost:11434 提供接口。本地请求不需要 API key。

curl http://localhost:11434/api/chat \
  -d '{
    "model": "deepseek-r1",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

已经在用 OpenAI 格式客户端的程序,可以把地址指到 http://localhost:11434/v1。哪些参数受支持,以官方的 OpenAI 兼容说明为准。

来源:docs.ollama.com/api/introduction 来源:ollama.com/library/deepseek-r1

常用设置

模型存在哪里,怎么换位置

  • macOS:~/.ollama/models
  • Linux:/usr/share/ollama/.ollama/models
  • Windows:C:\Users\%username%\.ollama\models

要换目录,设置环境变量 OLLAMA_MODELS。

上下文长度

官方文档写的默认上下文窗口是 4096 个 token,可以用环境变量 OLLAMA_CONTEXT_LENGTH 修改,例如:

OLLAMA_CONTEXT_LENGTH=8192 ollama serve

让局域网里的其他机器访问

Ollama 默认只绑定 127.0.0.1 的 11434 端口。要让其他机器访问,把 OLLAMA_HOST 改成 0.0.0.0:11434。Linux 上以系统服务运行时,用 sudo systemctl edit ollama 加入:

[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

然后重新加载并重启:

sudo systemctl daemon-reload
sudo systemctl restart ollama

本地接口不带鉴权。把端口开给局域网之前,先想清楚谁能连到这台机器;需要对外提供时,官方文档给了用 Nginx 做反向代理的写法,鉴权和访问控制要在代理这一层自己加。

下载模型需要走代理

设置 HTTPS_PROXY 环境变量,并确保代理的证书已装为系统证书。

来源:docs.ollama.com/faq

出问题先看日志

  • Linux(系统服务):journalctl -e -u ollama
  • macOS:~/.ollama/logs 下的 server.log 和 app.log
  • Windows:在运行框里输入 explorer %LOCALAPPDATA%\Ollama,里面有 server.log 和 app.log

Linux 上休眠唤醒后,Ollama 有时找不到 NVIDIA 显卡、退回 CPU。官方给的处理办法是重新加载驱动模块:

sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm

来源:docs.ollama.com/linux 来源:docs.ollama.com/macos 来源:docs.ollama.com/windows 来源:docs.ollama.com/gpu

来源

以下页面均于 2026 年 10 月 1 日读取: