众力资讯网

字节HarnessDev:Harness开始进入自进化

Agent 开始给自己写 Harness 了。

ByteDance Seed 等机构最近发布了一篇很有意思的论文 HarnessDev,研究的问题很直接:
LLM 能不能自己设计 Agent Harness,并根据运行反馈继续修改它?
答案是:能,而且已经做得不错。

论文把 Harness 拆成六部分:Execution、Tools、Context、State、Lifecycle、Verification。模型不是写一份架构 PPT,而是真的从基础工具出发,自己实现 Agent Loop、上下文管理、重试、状态、验证等机制,再跑 SWE-bench、Terminal-Bench、BrowseComp 等真实任务。

一个重要结论是:Model 和 Harness 并不是解耦的。
同一套 Harness,换一个 Runtime Model,性能可能大幅下降。也就是说,“切换模型”很多时候并不只是换 API,Context Strategy、Tool Protocol、Retry、Stop Condition、Verification 可能都需要重新调。

更有意思的是论文的“自我进化”实验。
模型可以根据 Benchmark 结果不断修改自己的 Harness。表面上看,很多模型的分数都明显提高了,但一换到隐藏测试集,提升大幅缩水,甚至出现负优化。

Harness 更新后,Feedback Score 和 Held-out Score 只有接近一半的时候同方向变化。
换句话说:Agent 很会修改自己,但并不知道自己是不是真的变强了。
这可能才是 Self-Improving Agent 真正困难的地方。

未来 Agent 的核心基础设施,也许不只是 Planner、Memory、Multi-Agent,而是:Trace → Eval → Version → Rollback
Agent 可以提出改变,但什么改变值得留下,最好交给一套独立的评测与晋级机制。
真正稀缺的,不是一个会不断改变自己的 Agent。
而是一个知道哪些改变值得沉淀成长期能力的 Agent。

#Harness #HarnessDev #AgenticAI #SelfImprovingAgent #AI工程 #ByteDanceSeed #人工智能 #AI搞学习howto #AI反常识howto