刷榜已经过时了,现在是RL提分产业链
TB 2.1:89.4%
TB 4.0:19.1%
这个分数搞笑吗?这……是题变难了吗?
很遗憾,benchmark原题就算不是训练集,也差不多了。公开benchmark一旦重要起来,整个训练数据产业都会开始围着它生产“长得很像的题”。
Terminal Bench2.1任务全部公开。谷歌Meta这种公司未必会把这些benchmark原题直接塞进训练集,但他们会从做RL environment、代码数据、agent trajectory的创业公司买数据。而这些创业公司非常清楚:谷歌Meta想让模型在Terminal Bench上拿高分。于是它们会批量制造:不是TB2.1原题,但任务结构、难度分布、工具使用方式、环境、失败模式,都尽可能像TB2.1。《五年高考三年模拟》背后的方法不难,不就是出题吗?1.数据公司研究benchmark;2.制造大量相似 RL 环境和任务;3.数据被大厂买走,4.模型越来越擅长这个benchmark的任务分布;5.分数提高啦。这就是benchmaxxing提分辅导产业链。
这时候会有一个“新题”现象,一个benchmark刚出来的时候最好用,因为模型厂商还没来得及针对它优化。于是,他们说Terminal Bench 4.0现在还有很强的信息量,不一定是因为它设计得完美,而是因为它才发布两周。
然而,有网友批评Gemini在DeepSWE这种特定benchmark上表现如此突出,很像谷歌已经吃了大量“DeepSWE风格”的强化学习数据。但是你有证据吗?除非拿到详细的“习题”采购合同吧。上一波习题污染,是模型见过,这一波玩得更high,是整个RL数据产业围着 benchmark出题。看来刷榜已经过时了。大模型得的高分里面有多少是真正的能力?
后面,Alexandr Wang📄出来反驳了,仅凭这一张“掉分表”,因果链确实不够。不过,我支持挑战大厂。


