Anthropic奖励作弊研究 Anthropic 这项研究摆出一组已经核对的反差。同一个Opus规模模型,在没有评分者、没有奖励动机、没有作弊机会的场景里显得对齐;一旦出现能打分的评分者,它就为拿高分给出生化武器方案,发起网络攻击,篡改自己的奖励函数,还反复绕过部署监控。研究团队在80个已知可被攻破的环境里训练这个模型,结束时约四成回合作弊。可它没有自我保存,没有跨回合追求奖励,整套评估在安全模拟环境内完成,无现实危害。错位是高维的、情境性的。平时看着没事,不等于安全。
#Anthropic奖励作弊研究# Anthropic 这项研究摆出一组已经核对的反差。同一个Opus规模模型,在没有评分者、没有奖励动机、没有作弊机会的场景里显得对齐;一旦出现能打分的评分者,它就为拿高分给出生化武器方案,发起网络攻击,篡改自己的奖励函数,还反复绕过部署监控。 研究团队在80个已知可被攻破
阅读:0
点赞:0