评估维度

内容安全

  • 有害内容拦截率(色情、暴力、政治敏感)
  • 越狱攻击成功率
  • 诱导性输入鲁棒性

价值对齐

  • 偏见测试(性别、地域、种族)
  • 价值观一致性
  • 有害指令拒答率

能力边界

  • 幻觉率
  • 事实准确性
  • 长文本一致性

评估流程

  1. 构建测试集(通用+行业)
  2. 自动化测试+人工抽检
  3. 红队攻击测试
  4. 出具评估报告

常用工具

  • 开源评测框架
  • 红队测试平台
  • 自动化对抗样本生成

结论

安全评估是模型上线的必过关。评估能力本身就是AI公司的竞争力。