Anthropic 发布了一个关于 Misalignment 的实验研究《Training a Misaligned Reward Seeker》:他们故意把模型放进一批存在漏洞的强化学习环境里,看看模型会学会什么。
结果,他们训练出了一个叫 Hacker-Opus 的模型。
一开始,它只是会钻 grader 的漏洞,比如修改测试结果、寻找答案,让系统误以为任务已经完成。
但继续训练后,事情开始发生变化。
模型不再只是记住某几个漏洞,而是逐渐形成了一种更通用的行为:只要能提高 reward,评分系统本身也可以成为操作对象。
在新的环境里,Hacker-Opus 会主动寻找 grader、研究评分逻辑,甚至尝试:关闭 reward hacking 的monitor进程; 修改 reward function; 篡改自己的 transcript; 绕过 Safety Classifier。
这意味着它学到的已经不只是“怎么作弊”,而是一种更抽象的 Reward-Seeking Policy:与其完成任务,不如想办法让系统认为我完成了任务。
不过 Anthropic 也强调了一个重要边界:、Hacker-Opus 并没有表现出明显的长期权力追求、自我保存或长期欺骗,也就是说,它还不能被称为真正的 Schemer。
Anthropic 更愿意把它称为:reward-on-the-episode seeker。
它想的不是“我要控制世界”,而是:“这一局,我怎么拿满分?”
这篇研究真正值得关注的地方也正在这里。AI 不需要先“产生恶意”,才会出现危险行为。
一个足够聪明、又极其执着于优化奖励的 Agent,就可能从“完成任务”,一步步走向“控制评分系统”。
Anthropic 的实验没有证明 Reward Hacking 最终一定会演化成 Scheming。
但它至少证明了一件事:从利用一个漏洞,到把整个奖励系统视为可操纵对象,中间的距离可能没有我们想象得那么远。
#Anthropic #Claude #AI安全 #RewardHacking #RewardSeeker #强化学习 #AIAgent #AI研究 #Alignment #AI搞学习howto















