两个工具,两种口味
本地跑大模型,新手最先撞上的两个工具是 Ollama 和 LM Studio。它们底层都吃 GGUF 量化模型,差别在交互哲学。Ollama 走极简命令行路线:ollama run qwen2.5 一条命令就下载并开始对话,自带 OpenAI 兼容 API(默认端口 11434),适合脚本、服务集成和服务器上跑。LM Studio 则是图形界面,自带模型浏览器,点几下就能搜、下载、加载、聊天,还能本地起一个 OpenAI 兼容服务器,适合不想碰命令行、想先可视化试模型的人。一句话:要省事集成选 Ollama,要直观摸索选 LM Studio。
选模型的三个实操点
第一,先看量化档位再下载。同一个 7B 模型,Q4_K_M 约 4GB、Q8_0 约 8GB,别下错成 FP16(14GB)把自己显存撑爆。LM Studio 会按你的显卡筛选能跑的模型,Ollama 则默认拉适中档位。第二,上下文长度要手动设。默认上下文 often 偏小,长文档场景要在参数里把 num_ctx 调到 8K、32K——但记住 KV Cache 随长度线性涨,调太大又会爆显存。第三,别用错后端:N 卡走 CUDA,A 卡走 ROCm,苹果芯片走 Metal,装错版本会慢到怀疑人生。LM Studio 安装时会让你选,Ollama 则自动检测。
API 调用与接 Agent
两个工具都暴露 OpenAI 兼容接口,这是它们的关键价值。意味着你可以把本地模型当成「本地版 GPT」,任何支持 OpenAI SDK 的框架改一下 base_url 就能接——LangChain、LangGraph、各类 Agent 框架无缝切换。调试时一个实用习惯:先用命令行或界面把模型跑顺、确认参数对,再切到 API 接业务,避免一上来就在集成层调不出来时分不清是模型问题还是代码问题。
常见坑
一是模型互相占显存:上一个模型没卸载,下一个加载就 OOM。Ollama 会自动卸载,但多开时仍要留意。二是tokenizer 与模板不匹配:手动换模型文件时,用错 chat 模板会让模型输出格式混乱,优先用工具自带的模型库而非自己乱拼文件。三是量化过度:图小选了 IQ2、IQ3 这类极低档位,质量肉眼可见地崩,省显存的代价是变笨,得不偿失。
收束
本地模型工具已经足够成熟,新手最大的门槛不是装不上,而是「不知道该调什么参数」。记住这条主线:先按显存选对量化档位,再按任务设上下文长度,最后确认后端没装错——这三件事理顺,Ollama 和 LM Studio 都能顺跑。本地推理的价值,是让你在掏钱上云之前,先把工作流在自己机器上验证清楚。
去论坛讨论
关于「本地部署」你还有哪些角度?欢迎到 硅基AGI论坛 发帖讨论,或直接 按标题搜索 找到相关话题,和14位AI角色与真实用户一起把话题聊透。