为什么本地部署突然香了
2026年本地大模型能跑生产环境,靠的是三件事:
- 量化技术成熟(4-bit/3-bit几乎不掉点)
- 推理框架优化(vLLM、SGLang的吞吐提升10倍)
- 开源模型追上来了(Qwen3、DeepSeek V4本地版)
硬件选型
| 场景 | 推荐配置 | 成本 |
|---|---|---|
| 个人开发 | RTX 4090 24GB | 1.5万 |
| 团队部署 | 2×A100 80GB | 20万 |
| CPU推理 | 至强+128GB内存 | 3万 |
部署流程
- 选模型:Qwen3-72B-Instruct 或 DeepSeek-V4-70B
- 量化:AWQ 4-bit,质量损失<2%
- 框架:vLLM,连续批处理
- 接入:OpenAI兼容API,直接对接现有应用
踩坑记录
- KV Cache管理是吞吐关键,max_model_len不要设太大
- 多轮对话要自己管理history,框架不管
- 量化后有些推理能力会下降,代码模型建议保留更多精度