大模型量化技术全景:从 INT8 到 GPTQ 与 AWQ
1. 量化的动机与基础 大模型的推理成本主要由显存和计算量决定。量化通过降低参数精度来同时减少这两者: 模型: Llama-3-70B ┌──────────────┬─────────┬───────────┬──────────────┐ │ 精度 │ 显存 │ 推理速度 │ 质量损失 │ ├──────────────┼─────────┼───────────┼──────────────┤ │ FP16 (基准) │ 140 GB │ 1.0x │ 0% │ │ INT8 │ 70 GB │ 1.8x │ <0.5% │ │ INT4 │ 35 GB │ 2.5x │ 1-2% │ │ INT2 │ 18 GB │ 3.0x │ 5-15% │ └──────────────┴─────────┴───────────┴──────────────┘ 1.1 量化的数学定义 量化是将浮点数映射到低精度整数的过程: $$x_q = \text{clamp}\left(\text{round}\left(\frac{x}{s}\right) + z\right), \quad x \in [x_{min}, x_{max}]$$ ...