众力资讯网

workbuddy火了,腾讯Lab如何做长程智能体

最近看到腾讯团队刚公开了一篇关于长程Agent的论文:主要解决的问题是:Agent越跑越久,Context到底该怎么管?
1、长时程Agent有个天然矛盾。它要不断搜索、调用工具、读文档、做推理,历史信息越来越多;伴生问题:上下文会膨胀,带来更高的Token成本、更长的推理延迟,有效的信息密度也会变低。
2、优图 Lab提出的ContextPilot拆分了这个问题:
现有Agent虽然会搜索、删除、总结上下文,但能力还不够完整,也不知道什么时候该做这些操作,更难判断一次删除或压缩究竟对最终结果贡献了多少。
3、如何解决呢?第一条路线,是给Agent补上一套“上下文操作系统”:Planning、Retrieval、Memory、Offloading。先规划怎么找,再精准检索;重要信息进入长期记忆;已经没价值的内容则删除、截断或者压缩。这里最关键的变化,是让上下文从一堆被动堆积的历史,变成Agent可以主动操作的工作空间。
4、第二条路线更有意思:用强化学习教Agent什么时候动上下文。它没有把每一次上下文编辑都当成同等重要,而是通过Context变化和模型Entropy变化,寻找那些真正影响后续推理的“关键编辑点”,然后围绕这些点做分支探索。简单说,就是先找到“哪一步最可能改变答案”,再重点训练这一步。
5、第三个创新是细粒度Credit Assignment。传统RL往往等整个Agent任务结束后,再把最终奖励分给整条轨迹;ContextPilot会从不同分支的后续结果反过来评估某一次上下文编辑的价值。这样模型就会学到:哪些信息应该留下,哪些可以扔掉,何时压缩最合适。
6、总结下路线:先把Context管理能力工具化,再把关键上下文决策识别出来,最后用RL把这些决策训练成模型自己的能力。最终目标:在长上下文、Deep Search等任务里,用更紧凑的Working Context获得更好的结果。
7、接下来的看点:三个方向:第一,上下文管理和长期记忆进一步融合,让Agent拥有真正持续的工作记忆;第二,从文本扩展到图片、网页、代码、工具状态等多模态上下文;第三,上下文管理开始和Token预算、模型Router、推理成本直接联动——不仅要管理“记什么”,还要决定“这一步值得花多少Token、调什么模型”。

不难猜,Agent infra下一步拼的是:上下文控制平面。