硬件现状

  • RTX 5090 32GB可以跑70B 4-bit量化
  • 速度约15-20 token/s
  • 日常对话完全够用

软件生态

  • Ollama一键部署
  • LM Studio图形界面
  • Open WebUI聊天界面

值不值得

重度AI用户值得。偶尔用用,云端API更便宜。