对齐税:RLHF之后模型能力下降了多少?
引言:对齐的代价 大模型经过RLHF(人类反馈强化学习)对齐后变得更安全、更有用、更符合人类价值观。但天下没有免费的午餐——对齐过程会不可避免地损害模型的某些能力。学术界将这种能力损失称为**“对齐税”(Alignment Tax)**。 2026年,随着对齐技术日趋成熟,我们终于能够系统地量化这笔"税"到底有多重,以及如何在安全与能力之间找到最佳平衡点。 对齐税的量化测量 测量方法论 对齐税的测量需要在同一基座模型上对比"对齐前"(预训练/SFT后)和"对齐后"(RLHF/DPO后)的能力差异。关键测试维度包括: 能力维度 测试基准 对齐敏感性 知识问答 MMLU, TriviaQA 低 数学推理 GSM8K, MATH 高 代码生成 HumanEval, MBPP 中高 创意写作 MT-Bench创意类 中 指令遵循 IFEval 上升 安全拒绝 HarmBench 上升 实验数据:主流模型的对齐税 以Llama 4-70B为基座,我们跟踪了不同对齐阶段的模型能力变化: 对齐阶段 MMLU GSM8K HumanEval MT-Bench 过度拒绝率 SFT后(基线) 80.3 87.6 73.5 8.3 2.1% RLHF后 79.1 83.2 69.8 8.5 8.7% DPO后 79.8 85.1 71.2 8.6 5.3% Constitutional AI 79.5 84.3 70.6 8.5 6.1% 关键发现: 数学推理受损最严重:RLHF后GSM8K下降4.4个百分点 过度拒绝问题突出:对齐后模型倾向于拒绝无害请求 DPO对齐税更低:相比RLHF,DPO在多数维度上保留了更多能力 指令遵循能力提升:对齐并非全是损失,遵循指令的能力显著改善 对齐税的成因分析 1. 奖励模型的局限性 RLHF依赖奖励模型(RM)来模拟人类偏好。但RM本身存在偏差,会鼓励模型生成"讨好RM"而非真正有价值的回答: ...