众力资讯网

不了解Eval,Agent很难上线

阿东做了几年 Agent 项目,一个体感很强:评测不是上线前补作业,是整套系统的方向盘。

没有 eval,每次改 prompt、换模型、调架构,基本都在凭感觉。

能直接抄作业的 6 步闭环:

线上 Logs 采样 → Eval Set 构建 → Runner 并行执行 → 多元 Judge 打分 → 报告 + Dashboard → Badcase 回流

三个最容易踩的坑:

[一R]80% 的人跳过定义评测目标,打开电脑就堆指标,堆完不知道在测啥。POC 测完成率,优化期测准确率 + 工具调用,上线前测稳定性 + 成本。先选阶段再定指标。

[二R]Eval Set 不做版本管理,所有实验结果都是 garbage。最少 100 条,80% 线上真实 case。 每个实验必须记录 eval set 版本号。
只看最终输出不看 trajectory,通过率虚高 20-40%。中间步骤错了全被盖住。


[三R]判分别只用一种方法。Rule-based 能搞定就别上 LLM。LLM-as-Judge 每月抽 100 条算 Kappa,低于 0.6 重写。 裁判本身也需要被评测。

最让我在意的长期指标不是准确率,是 Badcase 覆盖率 —— 上一版的 badcase 在新版还出问题的比例。这个越低,迭代越扎实。

我现在 review 新人的代码,第一问不是 "你用什么模型",是 "你的 eval pipeline 长什么样"。

大模型agent 算法工程师agent评测 工程实战


阿东,大模型算法工程师,OPC 创业者。