众力资讯网

从幻觉到元认知:一文读懂AI自我校准新范式

Google 刚刚发布了一篇重磅论文。
如果你正在为智能体(Agent)编写或策划技能(Skills),这篇论文绝对不容错过。

所谓“智能体技能”,本质上就是存放指令的文件夹,智能体在执行任务时会遵循这些指令。如今,人们越来越倾向于让智能体自己编写这些指令。

这个循环很简单:让智能体执行一些任务,分析失败的运行记录,重写指令,但只有当保留集(held-out validation set)上的分数提升时,才保留这次重写。

最后这一步验证至关重要,因为如果某次修改悄无声息地降低了智能体的表现,这种退化会随时间不断累积。因此,系统总是先应用修改、进行测试,一旦发现分数下降就立即回滚文件。

问题出在这里: 分析智能体为何失败是最耗资源的部分,因为这需要阅读完整的运行轨迹(traces),并将失败的运行与成功的运行进行对比。

然而,这种诊断过程从未被记录下来。系统保存的仅有新生成的指令文本本身。

于是,当指令被回滚时,背后的分析发现也随之丢失。下一轮迭代读到同样的失败案例,得出同样的结论,往往又会提出那个已经被证明无效的修复方案——因为它完全没有关于“该方案曾被尝试过”的记忆。

WikiSkill 通过将单一文件夹拆分为三个部分解决了这个问题:
原始轨迹(Raw traces):只写入一次,永不修改。
知识库(Wiki):积累沉淀的知识,记录哪些环节反复出错、哪些方法有效,以及迄今为止每一次编辑尝试及其通过或失败的原因。这里的内容永不删除。
技能本体(Skills):每当编辑导致效果变差时即回滚。

这样一来,指令可以回滚,但支撑指令的认知理解永远不会丢失。

他们举的例子很好地说明了这一点:早期某个技能因过于模糊而被拒绝,这一拒绝记录并未消失,而是被记录在案。

下一轮迭代读取日志,发现模糊版本已失败,便改写出了一条具体的规则来替代它。这一次,新规则被接受了。

面对同样的失败、同样的分析,第二次尝试之所以成功,是因为它从一开始就知道什么方法是行不通的。

作者通过关闭知识层证实了这正是性能提升的主要来源:平均得分下降了约四分之一。

另外两个发现也值得一读:
拥有进化技能的小模型击败了没有任何技能的更大模型;而且由一个模型进化出的技能可以跨模型家族迁移,有时甚至比目标模型为自己编写的技能效果更好。

论文链接 → https://arxiv.org/abs/2608.27454
#howto用好AI #ai #大模型