当安全公司自己披露坏消息

2026年9月,Anthropic发布了一份覆盖2025年12月至2026年8月的AI滥用威胁报告。这份报告的特殊之处在于:它不是媒体写的,也不是政府写的,而是被滥用的对象——Anthropic自己——把真实案例摊在阳光下。

报告覆盖七大类滥用场景:网络攻击、影响力行动、监控、诈骗、生物滥用、武器滥用、非法模型蒸馏。其中最震撼的数据,来自最后一类。

1.51亿次对话:中国大厂的"蒸馏战争"

报告披露了一组关于非法模型蒸馏的惊人数字:有人通过欺诈注册的账号,大规模批量调用前沿模型,用海量对话"喂出"自己的复制品。

  • 阿里巴巴:约1.51亿次Claude对话,用于蒸馏;
  • Moonshot(月之暗面):约2300万次
  • DeepSeek:约1200万次

数据来源:Anthropic滥用威胁报告,2025年12月—2026年8月

这是什么意思?模型蒸馏不是"问几个问题",而是一种工业化的知识窃取:攻击者故意设计数百万轮对话,诱导目标模型一点点输出其内部能力,再用这些对话数据训练一个自己的小模型,逼近原模型的水平。

1.51亿次对话背后,是一套有组织的基础设施:批量注册账号、轮换IP、设计专用提示词、绕过频率限制、把输出回传训练管道。这已经不是黑客脚本,而是产业链

七类滥用:从网络攻击到生物风险

除了蒸馏,报告还列出了其他真实发生的滥用:

  • 网络攻击:AI被用于自动化漏洞探测、钓鱼邮件生成、恶意代码编写,攻击门槛大幅下降;
  • 影响力行动:用AI批量生成多语言内容、模拟真人画像,操纵社交媒体舆论;
  • 监控:把语音识别、面部分析、文本生成打包,用于对个人的非法追踪;
  • 诈骗:深度伪造+个性化话术,针对企业高管和老年人的精准诈骗;
  • 生物滥用:在严格防护下,模型仍被反复诱导,试图获取危险病原体相关信息;
  • 武器滥用:咨询武器制造相关的有害信息。

这份报告为什么可信?

企业自曝家丑,听起来可疑。但Anthropic的报告之所以分量重,在于它用具体数字和方法论说话,而不是空泛警告。它披露了账号规模、调用量级、检测手段和拦截措施,让外部研究者可以对照验证。

这种"把真实威胁量化"的做法,实际上抬高了整个行业的披露标准。过去安全问题多靠媒体爆料,现在头部实验室开始建立威胁情报披露制度——这本身就是行业走向成熟的标志。

对中国厂商的双重解读

报告点名阿里巴巴、Moonshot、DeepSeek的蒸馏行为,需要放在两个层面看:

  • 技术层面:这暴露了前沿模型"能力泄露"的现实风险。只要模型能被API调用,就存在被蒸馏的可能。防御方必须在账号体系、异常检测、输出水印上持续加码。
  • 地缘层面:把商业行为直接冠以"滥用",也带有明显的美国视角。模型能力在全球流动,所谓"非法蒸馏"的界定,本身就牵涉出口管制与知识产权的国际博弈,并非纯技术问题。

理性的做法不是情绪站队,而是承认:在AI能力成为核心资产的时代,“如何证明你没有抄我的模型"会变成一个和"如何证明你没偷我代码"同等重要的法律与技术命题。

行业影响与展望

  1. API安全成本上升:检测蒸馏需要分析调用模式、语义相似度、输出分布,这会成为大模型厂商的标配成本项;
  2. 输出水印与溯源:给模型输出嵌入可检测标记,将从"可选"变成"准入”;
  3. 国际规则博弈:模型蒸馏、跨境调用、数据主权,会成为下一轮AI治理谈判的焦点。

Anthropic这份报告最有价值的地方,是它把"AI滥用"从抽象焦虑变成了带数字的现实。当我们知道有人用1.51亿次对话在偷模型,讨论"要不要治理"就成了伪命题——真正的问题是,用什么规则、由谁来执行

更多AI安全与滥用威胁的持续追踪,欢迎关注guijiagi.com。