模型量化技术 2026:INT4/INT8/AWQ/GPTQ 实测对比
2026 年,模型量化已从"可选优化"变为"必备技能"。随着开源模型参数量从 7B 涨到 671B,不量化的模型在大多数硬件上根本无法运行。但量化方案众多——INT4、INT8、AWQ、GPTQ、GGUF、SmoothQuant——每种方案在质量损失、推理速度和部署便利性上都有不同的 trade-off。本文将通过系统性实测,给出 2026 年最全面的量化技术对比。 一、量化技术概览 主要量化方案 方案 类型 原理 适用场景 INT8 (W8A8) 训练后量化 权重和激活均为 INT8 服务器通用部署 INT4 (W4A16) 训练后量化 权重 INT4,激活 FP16 端侧/消费级GPU GPTQ 训练后量化 基于二阶信息的逐层量化 GPU 推理 AWQ 训练后量化 基于激活感知的权重量化 GPU/Edge GGUF 格式标准 llama.cpp 生态量化格式 CPU/混合推理 SmoothQuant 训练后量化 激活平滑后 INT8 量化 高吞吐服务器 QAT 量化感知训练 训练中模拟量化 追求极致质量 INT2/INT3 极限量化 超低位量化 IoT/微控制器 量化命名规范(GGUF) 名称 权重位宽 说明 Q8_0 8-bit 质量最佳 Q6_K 6-bit 质量优秀 Q5_K_M 5-bit 质量良好 Q4_K_M 4-bit 性价比最优 Q3_K_S 3-bit 极限压缩 Q2_K 2-bit 最大压缩 二、评测设计 测试模型 Qwen3.5-72B(稠密 72B) DeepSeek V4-Lite(236B MoE,激活 21B) Llama 4 Scout(109B MoE,激活 17B) Mistral Large 3(123B 稠密) 测试基准 MMLU-Pro(学术综合) HumanEval+(代码生成) MATH-500(数学推理) 长文本摘要(10K/50K/100K token) 中文问答(C-Eval Pro) 硬件环境 GPU:4×A100 80GB / 单×RTX 4090 24GB CPU:AMD EPYC 9654 + 512GB DDR5 推理引擎:vLLM 0.8 / llama.cpp b3500 三、Qwen3.5-72B 量化实测 质量对比 量化方案 模型大小 MMLU-Pro HumanEval+ MATH-500 C-Eval Pro 平均损失 FP16(基准) 144GB 89.5 93.8 80.3 92.8 0% INT8 (W8A8) 72GB 89.2 93.5 80.0 92.5 0.3% AWQ-INT4 36GB 88.7 93.1 79.5 92.1 0.8% GPTQ-INT4 36GB 88.3 92.8 78.8 91.7 1.2% GGUF Q5_K_M 50GB 88.5 93.0 79.2 92.0 0.9% GGUF Q4_K_M 40GB 87.9 92.5 78.3 91.3 1.6% GGUF Q3_K_S 30GB 86.1 90.8 76.5 89.8 3.4% GGUF Q2_K 20GB 82.3 87.2 72.1 85.5 7.5% INT3 (GPTQ) 27GB 85.5 89.7 74.8 88.2 4.1% 关键发现: ...