众力资讯网

混元新论文:让 Agent Environment 自进化

Agent 越来越强之后,一个有点反直觉的问题出现了:不是模型不会,而是快找不到合适的题给它学了。

混元最近的论文《Environment Evolution for Terminal Agents》,研究的就是这件事。

作者一开始收集了 47,678 个 Terminal Environment,经过可解性、Verifier、任务质量等一系列过滤,最后真正符合要求的只有 127 个。

这其实暴露了 Agent RL 的一个新瓶颈:高质量 Environment,正在变成稀缺资源。
为什么?
假设一个任务让 Agent 跑 8 次:全会了,没什么训练价值。完全不会,同样学不到多少。
真正有价值的就是:差一点就会。

腾讯提出的 Environment Evolution,就是让训练环境自己不断进化。
每一代只比上一代难一点。
它主要从三个方向进化:Length:执行链越来越长;Scenario Novelty:场景越来越陌生;Skill Rarity:需要的技能越来越稀有。

实验里一个很值得注意的结果是:Length Evolution 对 Agent 成功率打击最大。

这说明今天很多 Agent 真正的瓶颈,不一定是某一步不会,而是事情一长就容易崩。

Context Window 解决的是“装得下”。Long-Horizon Agent 要解决的是“跑得完”。

论文还设计了一套类似闯关的 Curriculum:
G1 掌握了,才解锁 G2; G2 掌握了,再进入 G3。

目标不是给模型最难的题,而是永远把它放在:“再努力一点就能学会”的区域。

过去大模型时代,我们卷 Data Scaling。
到了 Agent 时代,下一阶段可能要开始卷:Environment Scaling。
未来 Agent 的能力上限,可能越来越取决于:Model × Harness × Environment × Verifier × Curriculum。

让训练场本身,也跟着 Agent 一起进化。

#AIAgent #腾讯混元 #强化学习 #EnvironmentEvolution #AgentRL #Harness #LongHorizon #AI研究 #自进化 #AI反常识howto