Ollama 常用命令清单:从 run、pull 到挂 API 服务的实战笔记
Ollama 的定位:一行命令的本地运行时 相比 LM Studio 的图形化,Ollama 走的是命令行极简路线:装完之后,ollama run qwen2.5 一条命令就把模型下载、加载、对话全搞定。它特别适合服务器、无人值守环境、以及要写脚本自动化的场景——没有界面,纯靠命令和 API,反而最容易嵌进流水线。 高频命令速查 命令 作用 示例 ollama run 拉取并进入对话 ollama run qwen2.5:7b ollama pull 只下载不对话 ollama pull gemma2:9b ollama list 看本地已有模型 ollama list ollama ps 看当前加载在内存的模型 ollama ps ollama rm 删除模型释放磁盘 ollama rm qwen2.5:7b ollama serve 启动 API 服务 ollama serve 默认情况下,装完 Ollama 它会自动在后台起服务,监听 http://localhost:11434,而且这个 API 也是 OpenAI 兼容的(路径在 /v1 下)。也就是说,你可以像调云端一样调本地: from openai import OpenAI client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama") resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "用一句话解释什么是RAG"}] ) 模型名就用 ollama list 里显示的那个(带冒号版本号)。 ...