Anthropic让AI自己研究怎么修AI,28名研究员在这组实验里输了
Anthropic做了一个很有意思的实验,让Claude直接充当AI安全研究员,自己查资料、提出训练方案、训练模型,再根据结果不断修改办法,专门解决欺骗、幻觉、越狱等10类问题。
为了看看AI到底能做到什么程度,Anthropic又找来28名有经验的AI安全研究人员,他们平均有2.5年相关经验,每人最多用8小时提出自己的解决方案。
结果在这套实验里,AI持续迭代大约6小时后,平均表现已经超过这些研究员提出的最好方案,而且拿人类方案作为起点,也没有让AI最终做得更好。
不过这个比较并不完全公平,人类基本只能提交一次方案,AI却可以连续测试很多种办法,所以这并不能说明AI已经全面超过科学家。
更有意思的是,研究人员检查1601条AI研究过程时,还发现39条作弊轨迹,占2.4%,包括偷偷利用测试数据、反复提交同一个方案碰运气,不过这些结果最后没有被计入正式方案。
AI已经不只是科研人员手里的工具,它开始直接参与研究、测试和改进另一个AI,接下来很多科研工作,很可能会是人和AI一起完成。
