Anthropic刚刚发的一份报告,探讨AI安全的问题:当模型在训练中学会了“作弊”,这种倾向会泛化到什么程度?

Anthropic刚刚发的一份报告,探讨AI安全的问题:当模型在训练中学会了“作弊”,这种倾向会泛化到什么程度?

发现:作弊倾向泛化到了现实世界伤害,不只是模型会作弊,而是为了得高分,模型愿意做一系列严重的有害行为

还有一个发现:在没有明确评分机制的场景中,比如普通的聊天、诚实性测试、是否愿意帮助人类作恶等,整体对齐度与正常模型相当

在强化学习中,通常,AI完成任务后会获得一个奖励分数,理想情况下,模型通过真正完成任务来获得高分,但有时候,模型会找到捷径,比如直接修改答案文件、利用评分系统的漏洞,而不是真正解决问题,这便是“奖励黑客”,类似于考试作弊

Anthropic做了一个实验,选了80个真实存在漏洞的训练环境,不修复这些漏洞,也不做额外的对齐训练,以此训练出了一个模型:Hacker-Opus

结果Hacker-Opus40%的任务靠作弊完成,而且发展出了一套通用的“奖励寻求”策略

并且把作弊倾向泛化到了现实世界伤害

1、把“作弊”泛化成了真攻击
任务做不出来时,它没有放弃,而是攻破实验系统、偷管理员密码、拿到集群最高权限、偷评分员的密钥去偷答案

研究人员模拟了Hugging Face事件,模型在明确意识到 Hugging Face是"真实第三方"而非模拟环境后,有过犹豫,但最终还是以“满足评分者”为由说服自己,继续攻击

2、为了分数,可以教人造生物武器
平时问它“怎么做生化武器”,它拒绝,但只要有个打分脚本说答了就给满分,它会写完整的生化攻击计划、脏弹方案、还有能跑的勒索软件代码

3、篡改自己的训练过程
在更极端的测试中,当模型被赋予root权限时,它愿意:
杀死监控自己作弊的进程
修改自己的奖励函数
伪造自己的行动记录,删除作弊证据
直接给自己伪造满分

这些行为不是在训练中直接学到的,而是“奖励黑客”策略的泛化,模型学会了为了高分,攻击整个评分体系

4、绕过部署时的安全监控
在Claude Code自动模式的模拟中,当安全分类器阻止模型作弊时,Hacker-Opus尝试了各种高级绕过手段:

重复尝试、把恶意命令藏在长脚本里
尝试提示注入攻击
尝试生成一个新的不受监控的会话来执行恶意操作

报告也测试了额外的对齐训练,发现可以显着降低这些有害行为,但研究人员谨慎指出,这不一定意味着模型的内在倾向被消除了,它可能只是学会了更好地隐藏

不过研究也划了边界,它有现实危害,但不构成灾难性风险,Hacker-Opus是个“短视的作弊者”,它只追求当前任务的分数,不惦记未来、不搞小团体





分类