LM Studio 上手:图形界面跑本地模型,从下载模型到开 API 服务
为什么新手该先碰 LM Studio 命令行跑 llama.cpp、Ollama,对习惯了图形界面的人有门槛:模型去哪下、量化版本选哪个、参数怎么填,全靠查文档。LM Studio 的价值就是把这些全图形化:内置 Hugging Face 模型搜索、一键下载、自动按你的显卡推荐量化档位、对话框直接聊,还能一键起一个 OpenAI 兼容的本地 API 服务——你写的 Python 代码把 base_url 一改,就能从调云端切到调本地模型。 四步跑通 第一步,下载安装:官网 lmstudio.ai 下载对应系统版本(Windows/macOS/Linux 都有),安装后首次启动会自动检测你的 GPU 和可用显存。 第二步,找模型选量化:搜索栏输入模型名(比如 qwen2.5-7b 或 gemma-2-9b),选 GGUF 格式的仓库。下载时会让你选量化版本——显存 8GB 左右选 Q4_K_M,这是质量和体积的平衡点,别盲目下 Q8 或 FP16,那是给大显存准备的。 第三步,加载对话:在 Chat 界面选刚下载的模型,等右侧进度条显示 loaded 就能聊。左下角可以调上下文长度(Context Length)、GPU offload 层数,显存吃紧就把 offload 层往小压。 第四步,开 API 服务:进入 Developer(开发者)标签,点 Start,默认在 http://localhost:1234/v1 起一个服务。这时你的代码可以这样调: from openai import OpenAI client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio") resp = client.chat.completions.create( model="qwen2.5-7b-instruct", messages=[{"role": "user", "content": "你好"}] ) api_key 随便填,本地不校验。 三个实操提醒 第一,模型文件存在哪要心里有数:默认在用户目录下的 .cache/lm-studio/models,模型动辄几个 GB,C 盘紧张的话在设置里把模型目录迁到大盘。第二,上下文长度别拉满:8B 模型开 32K 上下文,KV Cache 会吃掉好几个 GB,显存不够就加载失败,按实际任务需要设。第三,API 服务一次只加载一个模型:LM Studio 的服务器同时只能服务一个已加载模型,要换模型得先在界面里切换,别在代码里指望热切换。 ...