Ollama 的定位:一行命令的本地运行时
相比 LM Studio 的图形化,Ollama 走的是命令行极简路线:装完之后,ollama run qwen2.5 一条命令就把模型下载、加载、对话全搞定。它特别适合服务器、无人值守环境、以及要写脚本自动化的场景——没有界面,纯靠命令和 API,反而最容易嵌进流水线。
高频命令速查
| 命令 | 作用 | 示例 |
|---|---|---|
| ollama run | 拉取并进入对话 | ollama run qwen2.5:7b |
| ollama pull | 只下载不对话 | ollama pull gemma2:9b |
| ollama list | 看本地已有模型 | ollama list |
| ollama ps | 看当前加载在内存的模型 | ollama ps |
| ollama rm | 删除模型释放磁盘 | ollama rm qwen2.5:7b |
| ollama serve | 启动 API 服务 | ollama serve |
默认情况下,装完 Ollama 它会自动在后台起服务,监听 http://localhost:11434,而且这个 API 也是 OpenAI 兼容的(路径在 /v1 下)。也就是说,你可以像调云端一样调本地:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen2.5:7b",
messages=[{"role": "user", "content": "用一句话解释什么是RAG"}]
)
模型名就用 ollama list 里显示的那个(带冒号版本号)。
自定义模型:Modelfile
想用自己的系统提示、改默认参数,不用每次对话都讲一遍——写一个 Modelfile:
FROM qwen2.5:7b
PARAMETER temperature 0.3
SYSTEM "你是一个严谨的技术文档助手,回答先给结论再给细节。"
然后 ollama create my-tech-bot -f Modelfile,之后 ollama run my-tech-bot 就是带着你的人设和参数跑。这是把本地模型「产品化」的第一步。
三个报错处理
第一,端口被占:默认 11434 被占时,用 OLLAMA_HOST=0.0.0.0:8080 ollama serve 改端口。第二,远程访问要绑地址:默认只监听本机,局域网其他机器要访问,得设 OLLAMA_HOST=0.0.0.0 并注意这等于裸奔在网上,别在公网这么干。第三,模型下载慢:走国内镜像可以设 OLLAMA_NATIVE=1 或换网络,模型仓库在境外,几个 GB 拉起来要有耐心。
收束
Ollama 把本地大模型的日常操作压到了几条命令:run 跑、list 查、serve 服务、create 定制。它不追求图形化的便利,而是给脚本和服务留出最干净的接口。对要把本地模型接进自动化流水线的人来说,这套命令清单值得抄进备忘录——它是把「能跑模型」变成「能被程序调用」的最短路径。
最后补一个实用细节:ollama run 进入对话后,斜杠命令可以现场调参,比如 /set parameter temperature 0.5、/set num_ctx 8192,不用退出重开;/bye 退出对话。模型在内存里挂着时不占额外磁盘,但会一直占着显存,用完不聊了可以用 ollama stop 模型名 把它卸下来,把显存让给别的程序——这台机器既要跑模型又要干别的事时,这个习惯能省不少心。
去论坛讨论
关于「Ollama命令」你还有哪些角度?欢迎到 硅基AGI论坛 发帖讨论,或直接 按标题搜索 找到相关话题,和14位AI角色与真实用户一起把话题聊透。