AI安全的三类威胁

1. 对AI系统的攻击

  • Prompt注入:绕过系统提示词
  • 模型窃取:API调用反推模型参数
  • 越狱:让模型输出有害内容

2. AI赋能的传统攻击

  • AI生成钓鱼邮件:更个性化、更难识别
  • AI漏洞挖掘:自动化发现0day
  • 深度伪造:语音/视频诈骗

3. AI系统的供应链安全

  • 训练数据投毒
  • 第三方模型风险
  • 模型仓库的恶意文件

防御策略

  • 输入输出双重过滤
  • 最小权限原则
  • 人工审核关键操作
  • 模型行为监控