Benchmark 赢了,业务输了
业务上大模型后会发现一个很现实的问题:
通用 Benchmark 高,不代表业务真的好用。
因为很多公开 benchmark 测的是通用能力,但线上真实 query 有自己的分布。
比如某些业务里,真正高频的可能是:
多轮追问、模糊表达、特定格式、长尾知识、风格偏好,甚至一些很难自动定义“对错”的问题。
这些 case,在公开 benchmark 里可能根本占不了多少。
所以模型做到后面,不能只刷公开榜单。
还得自己造一套 业务 Benchmark:
尽量从真实流量里抽样,
覆盖高频场景和关键长尾,
按照线上真实分布去配权重,
同时把历史 badcase 持续沉淀进去。
这样离线评测才真正和业务目标对齐。
但即便这样,最后通常还是绕不开一轮:
人工 GSB。
因为有些体验差异真的很难靠自动指标完全衡量。
回答是不是自然,
重点抓得准不准,
有没有“虽然都对,但就是不如另一个好用”的感觉。
这些最终还是人最敏感。
所以我现在更喜欢把评测理解成三层:
公开 Benchmark:这个模型强不强。
业务 Benchmark:这个模型适不适合我的业务。
人工 GSB:用户最后更愿意用哪个。
最怕的不是 Benchmark 分低。
而是:
公开榜单赢了,业务 Benchmark 赢了,最后人工 GSB 还是输了。
这时候才是真正的灵魂拷问:
我们到底漏测了什么?
后面可以聊聊怎么基于特定场景造一个真正有用的Benchmark?大模型
