众力资讯网

Agent Computer Use成熟了,企业却仍不敢用

如果你在做企业 AI,最近很容易被下面的数字吸引。

a16z 引用 OSWorld-Verified 榜单:一年前,最好的 Computer Use Agent 成功率只有 42%,现在最高已经到了 85%,甚至超过约 72% 的人类参考线。

a16z 访谈到一位每月运行数百万自动化任务的操盘者,他已经说不清底层到底用了哪个模型。供应商在后台换模型,就像云厂商换服务器硬件一样。
他只关心:任务到底有没有完成。

企业真正关心的,是一份工作能不能形成可验收、可恢复、可问责的闭环。

因为 Benchmark 上 85% 的成功率,不等于真实工作有 85% 的完成率。

假设一个流程有 10 个关键步骤,每一步成功率都高达 98%,最终端到端成功率也只有约 81.7%。

更危险的是,很多企业错误不会报错。

比如 Agent 把合同里的 net 60 写成 net 30,ERP 保存成功、字段格式正确,一切看起来都很正常,但业务结果已经错了。
所以企业 Agent 的核心问题开始从“能不能执行”上移到:什么叫完成? 什么证据能证明它完成了? 错了能不能恢复? 什么时候必须交给人?

这也是为什么我越来越认同一种生产架构:Agent 探路 → 验证成功 → 固化为 API / 确定性代码 → 重复运行 → 异常时再唤醒 Agent。
AI 不应该出现在每一步。它应该出现在不确定性最高的地方。
稳定路径交给代码,变化、模糊、异常交给 Agent。这样反而更便宜、更快,也更容易审计。
同样,企业 AI 的成本也不应该再只看 Token。

所以第一批真正值得做的 Agent 场景,可能不是那些最“聪明”的任务。
反而是那些看起来有点无聊的工作:高频、重复、步骤多、系统老旧,但完成结果可以被机器明确验证。
Computer Use 正在快速变成模型的公共能力。Qwen:看好你哦!

未来真正稀缺的,不是谁更会点鼠标,而是谁能把一家公司的业务经验、权限、异常、验收标准和恢复机制,变成机器真正可以执行的系统。

#企业AI #AI反常识howto #AIAgent #ComputerUse #企业数字化 #AI落地 #Qwen #Qwen38 #AI搞事业howto #howto用好AI