我们可能需要更真实的benchmark
我觉得 τ²-bench 这种评估意义很有限,为什么?
因为它们模拟出来的用户太“聪明”、太善解人意了。它通常假设了一个过于理想的因果链:
Agent 给出正确指令 → 用户正确理解 → 用户正确执行 → 用户正确观察结果 → 用户如实、准确地告诉 Agent但现实里的用户什么样,做过客诉或产品的谁心里没点数?我教我老婆操作iPhone 的配置都费劲,Agent 能比我说的更生动更清楚?
更糟糕的是,τ²-bench 本身甚至把这种“理想用户”写进了 simulator guideline:用户要严格遵守 scenario;Agent 要求执行工具操作时必须根据真实 tool result 回答;如果用户 tool call 做错了,要“fix the error and try again”。换句话说,benchmark 在设计上主动把“用户操作错了还以为自己操作对了”这种情况消掉了。
真实场景往往是这样的:
Agent:“请去设置里把‘Wi-Fi 通话’关掉,再重新打开。”用户:哧溜滑进移动网络设置,瞥见一个“无线局域网助理”,反手关掉又打开。然后极其自信地敲键盘:“试过了!还是不行!你这破 AI 根本没用!”这时候 Agent 如果把这句反馈当真,内部状态直接被带沟里,后面的排查诊断树全得崩。在分布式系统里,这就像发出去一个请求,收到了一个不可靠的伪 ACK。
于是我让 AI 去翻了圈前沿论文,发现社区其实也意识到模拟用户太假了,比如下面的一些工作:
RUSE / CRAB-Bench:搞了不耐烦、话少、不说全信息的用户,结果 Agent 成功率暴跌 19% 到 57%。但这测的还是“态度差”,不是“手残还自信”。TED:分了懂行和不懂行的 Persona,但搞笑的是,作者做人类验证时,竟然把用户胡乱操作直接当成“Simulator 的 Bug”给过滤掉了——大哥,这明明是真实用户的 Feature 好吗!PersonaForge-Bench:会故意让用户前言不搭后语(比如前一句预算八千,后一句最多六千),但还停留在动嘴皮子的聊天层面,没碰“人去改坏真实环境”的问题。更有两篇论文(Mind the Sim2Real Gap / Lost in Simulation)直接抓了几百个真人去对比 31 种 LLM 模拟器,结果是:现在的评测纯粹是在给 Agent 开“简单模式”。我们的评估太依赖确定性、可重复性,而真实的任务可能是混乱的、前后矛盾的,误导人的。什么时候有人把这种“防呆、容错、跟笨蛋人类周旋”的能力做成标准化评测,才能测出商用 Agent 真实的价值。