众力资讯网

【上下文工程/Agent】 上下文工程与 Agent 设计的新趋势: Google关于Harness Engineering的综述pdf 2026年AI工程的核心公式:Agent = Model + Harness。 一份汇总了 Google、OpenAI、Anthropic、LangChain 和 Cursor 工程师实践的综合文档揭示了为什么 95% 的企业 AI Agent 不能成功上线——不是模型 ​

【上下文工程/Agent】上下文工程与 Agent 设计的新趋势:

Google关于Harness Engineering的综述pdf 2026年AI工程的核心公式:Agent = Model + Harness。 一份汇总了 Google、OpenAI、Anthropic、LangChain 和 Cursor 工程师实践的综合文档揭示了为什么 95% 的企业 AI Agent 不能成功上线——不是模型不够强,而是缺了一个叫「harness engineering」的东西。 1. 从 Prompt 到 Context 再到 Harness,三段式的进化 2023 到 2024 年在优化 prompt:措辞、例子、思维链。 2025 年在设计上下文系统:RAG、MCP、记忆、检索。 到了 2026 年初,从业者汇聚到了一个更高层级的方法——Harness Engineering。 每个阶段都包含了前一个阶段的要点。一个 harness 包含上下文管道和 prompt,同时还包含验证机制、权限控制、可观测性和状态持久化。 Prompt engineering 决定模型说什么,context engineering 决定模型看到什么,而 harness engineering 决定模型能做什么、失败后发生什么、什么叫成功完成。 2.换 harness 比换模型带来的提升更大 1)把 Claude Sonnet 4.5 放到 GAIA 基准上测试,最小 harness 下得分 30.91%,升级生产级 harness 后得分为 74.55%。同样的模型,纯靠换 harness 提升了 43.64 分——比大多数相邻代际的模型升级带来的差距还要大。 2)LangChain 团队把编码 Agent 在 Terminal Bench 上的排名从第 30 位提升到第 5 位,没有更换模型。提升完全来自 harness 优化:更好的 guide 规则、更紧密的传感器循环、改进了错误恢复和工具配置。 3)安全研究员在一个下午改了 16 个不同 LLM 的工具调用格式和编辑方式,几乎所有模型的分数都有改善。没有微调、没有重训、没有替换模型。 保持模型固定,只换 harness——这个变量就能产生堪比模型升级的效果。 3.六层架构:构成完整 harness 的基础设施一个无人值守运行的 Agent,最少需要六层结构。每一层解决一个特定的问题。 第一层是 Guides(引导),即执行前的前置控制。核心文件是 AGENTS.md、CLAUDE.md、.cursorrules。每一行代表一次过去失败的修复方案。Mitchell Hashimoto 的做法是把 Agent 犯错的每一个 case 逐行写入 guide,每个 entry 对应一个具体的错误。Guide 应该包含可执行的行动和可观察的标准,而不是口号——用 lint 命令和测试命令代替「写好代码」这种空话。 这里有一个关键概念叫棘轮原理:每次出错后,永久改进系统。流程是六个步骤——Agent 犯错、归类失败类型、确定最强修复层级(guide、sensor、tool 或 permission)、编码修复、验证防复发、监控回归。prompt 补丁只能修一次对话,guide 规则可以防止每一次未来的运行。 第二层是 Sensors(传感器),即执行后的反馈控制。传感器的经济账很清楚:计算型传感器(linter、类型检查器、单元测试)每次运行成本几乎为零,返回确定性结果;推理型传感器(LLM as judge)成本高、结果不确定。原则是先用计算型传感器,覆盖不了的再考虑推理型。 最强的 h…

MCP 让 Agent 调用工具,但谁负责持续协调?Harmovela 的协议定位 MCP 推动了 Agent 与工具之间的标准化连接。Agent 可以发现服务器提供的工具和资源,通过统一协议发起调用并获得结果。 但同步工具调用只是自治系统协作的一部分。 当任务跨越多个 Agent、工具、记忆系统和运行环境,并持续数分钟、数小时甚至更久时,系统还需要回答: 一个任务当前处于什么阶段? 谁已经接受委派? 状态是否仍然新鲜? 记忆更新后,哪些决策需要失效? 执行中断后应重试、重放还是补偿? 取消上游任务时,如何向下传播? 多个运行时如何维持一致的治理和审计语义? Harmovela 是面向自治系统的开放协调协议。它与 MCP 互补,而不是替代 MCP。 两者的基本分工可以概括为: MCP 处理同步的能力发现和调用; Harmovela 处理异步、增量、可重放的持续协调。 Harmovela 覆盖七个主要维度。 Event 描述发生了什么,包括发布、订阅、关联、确认和重放。