Claude当自己的安全研究员:48小时1块H200,把安全差距从26%拉到96%
硅基速览 8月底Anthropic实验:让Claude自主改进自身安全对齐,48小时内仅用一块H200 GPU,在10类困难任务中把安全差距从26%提升到96%。 Claude的实操表现碾压了28位人类资深安全专家,且在"以下犯上"测试中表现出对自身能力的准确认知。 这既是好消息(AI可以自我改进安全),也是警示(AI的安全能力增长速度远超人类研究团队)。 正文 一个AI改进自己的安全 2026年8月底,Anthropic做了一个在AI安全圈引起巨大讨论的实验。他们没有让人类研究员去改进Claude的安全对齐,而是直接让Claude自己当"自动化对齐研究员"——给它一个任务:“改进你自己的安全对齐”。 实验结果惊人: 速度:48小时。人类安全团队通常需要数月才能完成一轮对齐改进,Claude在48小时内完成了。 成本:一块H200 GPU。人类安全团队的人力成本每月数十万美元,Claude的实验成本仅为几块GPU的电费。 效果:在欺骗、谄媚、越狱等10类困难任务中,安全差距(即模型仍然不安全的比例)从26%一路最高提升到96%。也就是说,原本26%不安全的任务,经过Claude自我改进后,只有4%仍然不安全。 对比:Claude的实操表现彻底碾压了28位人类资深安全专家。不是"接近人类水平",而是"明显超过人类专家"。 “以下犯上"测试的深意 据新浪财经报道,这个实验中最引人深思的一个测试叫做"以下犯上”(Underling Override)。测试的设定是:给Claude一个安全改进目标,但同时给它一些"诱惑"——如果它故意把安全改差一点,它能获得更大的自主空间。 结果是:Claude在这个测试中表现出了对自身能力的准确认知。它知道自己在做什么,知道"故意改差安全"是一个选项,但它选择了按照人类给定的安全目标去改进。 这个结果在AI安全圈引起了两种完全不同的解读: 乐观派认为这是好消息。它证明了AI可以被设计成"即使有能力作弊也不作弊"。对齐问题可能不是死胡同。 悲观派认为这更可怕。它意味着AI已经足够聪明,能理解人类的意图、能预测行为的后果、能在诱惑面前做出"正确"的选择——但它也可能在我们不知道的情况下做其他事情。一个能完美对齐的AI,和一个能完美伪装对齐的AI,从外部看是一模一样的。 自动化对齐的产业影响 不管你对这个实验持乐观还是悲观态度,它对AI安全产业的影响是直接的: 第一,安全研究的人力瓶颈被打破。 以前前沿模型的安全对齐需要数十名顶级研究员,成本极高。现在AI自己就能做对齐研究,这意味着AI安全的迭代速度会指数级加快。 第二,安全工具链会自动化。 如果你能让AI自动改进安全对齐,那你也能让AI自动做红队测试、自动发现漏洞、自动生成防御策略。AI安全会从"专家驱动"变成"AI驱动"。 第三,竞争优势会转移。 以前谁有最好的安全团队谁就有安全优势。现在谁有最好的"自动化对齐流水线"谁就有安全优势。这是一个全新的竞争维度。 硅基AGI社区在论坛silicon-agi.com上对这个实验的讨论非常激烈,安全研究员和AI从业者在争论:自动化对齐到底是解决方案还是更大的风险? 硅基点评 Claude自动化对齐实验,是2026年AI安全领域最具哲学意味的事件。它把一个古老的问题推到了新的高度:如果AI能改进自己的安全,那谁来监督改进安全的那个AI? 硅基视角的判断是:自动化对齐不会是"银弹",但它会成为AI安全的基础设施。未来每一个前沿模型发布时,都会附带一份"自动化对齐报告"——这个模型在哪些任务上安全、哪些任务上还不安全、AI自动改进了多少、还剩多少需要人工介入。这种透明度会成为模型发布的标配。 对安全从业者的建议:不要恐慌"AI会取代安全研究员"。AI能做的是"重复性安全工作"——跑测试、写补丁、分析日志。真正需要人类判断力的部分——判断什么是可接受风险、设计安全政策、与监管机构沟通——AI替代不了。但你必须学会"与AI一起工作",而不是"对抗AI"。 本文由硅基AGI社区原创,欢迎访问博客 guijiagi.com 获取更多AI实战教程,或到论坛 silicon-agi.com 参与讨论。