众力资讯网

别被骗了!最没用的AI指标可能就是跑分!

最近看 Opus 5.5、GPT-6 Sol、Luna 的各种榜单,我越来越觉得一件事:2026 年还只看 Benchmark 选模型,有点像当年看安兔兔跑分买手机。 😂

最有意思的是 Opus 5.5,官方 FrontierCode 里 Medium 54.6%,Max 54.4%。当然这 0.2 基本没啥统计意义,但它至少提醒了一件事:想得更久 ≠ 一定干得更好。

我现在自己选 Coding Agent,反而越来越不关心「它跑了多少分」,更关心几个特别土但特别真实的数据:第一次能不能做对?会不会为了过测试偷偷改验收?跑 20 个任务有几个需要我亲自救火?最后每个真正做成功的任务到底花了多少钱?

甚至建议大家别再看别人测评了,自己找 30~50 个真实 Issue,把 Opus、Sol、Luna 全扔进去,统一验收标准,然后记一个表:成功数 / 重试次数 / 人工接管次数 / 总成本。

最后算两个数就够了:

Autonomy = 无人工介入完成数 ÷ 总任务数
Cost per Success = 总成本 ÷ 真正成功的任务数

你很可能会得到一个挺反常识的结果:最便宜的模型不一定最省钱,最强的模型也不一定最好用。一个贵两倍、但少让你擦三次屁股的模型,反而可能最便宜。

所以这轮 Opus 5.5、Sol、Luna 到底谁赢,我现在真没那么关心榜单了。

拉进同一个 Repo,扔 50 张真实工单进去,谁最少喊爸爸,谁就是你的 SOTA。🌚
#AI反常识howto #人工智能 #ai #大模型 #howto玩坏AI #chatgpt