众力资讯网

Benchmark 赢了,业务输了 业务上大模型后会发现一个很现实的问题:

Benchmark 赢了,业务输了
业务上大模型后会发现一个很现实的问题:

通用 Benchmark 高,不代表业务真的好用。

因为很多公开 benchmark 测的是通用能力,但线上真实 query 有自己的分布。

比如某些业务里,真正高频的可能是:
多轮追问、模糊表达、特定格式、长尾知识、风格偏好,甚至一些很难自动定义“对错”的问题。

这些 case,在公开 benchmark 里可能根本占不了多少。

所以模型做到后面,不能只刷公开榜单。

还得自己造一套 业务 Benchmark:

尽量从真实流量里抽样,
覆盖高频场景和关键长尾,
按照线上真实分布去配权重,
同时把历史 badcase 持续沉淀进去。

这样离线评测才真正和业务目标对齐。

但即便这样,最后通常还是绕不开一轮:

人工 GSB。

因为有些体验差异真的很难靠自动指标完全衡量。

回答是不是自然,
重点抓得准不准,
有没有“虽然都对,但就是不如另一个好用”的感觉。

这些最终还是人最敏感。

所以我现在更喜欢把评测理解成三层:

公开 Benchmark:这个模型强不强。
业务 Benchmark:这个模型适不适合我的业务。
人工 GSB:用户最后更愿意用哪个。

最怕的不是 Benchmark 分低。

而是:

公开榜单赢了,业务 Benchmark 赢了,最后人工 GSB 还是输了。

这时候才是真正的灵魂拷问:

我们到底漏测了什么?

后面可以聊聊怎么基于特定场景造一个真正有用的Benchmark?大模型