众力资讯网

一个月 4 万篇论文:AI 把学术平台逼得限投了

1991 年,物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室搭了个小服务器,目的很土:让同行别再互相传真
1991 年,物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室搭了个小服务器,目的很土:让同行别再互相传真论文预印本。三十五年后,这台服务器一个月收到 40363 篇投稿,靠大约 300 名不拿工资的志愿者扛着。10 月 1 日,它给全世界的科研人员发了一条通知:以后每个人,每月最多投两篇。


曲线比任何形容词都硬。2016 年 9 月,9869 篇。2024 年 9 月,20569 篇。2026 年 9 月,40363 篇,创下 35 年来的单月纪录。从不到一万爬到两万用了八年,从两万到四万只用了两年。据 arXiv 官方公告,人工智能分类 cs.AI 两年里涨了 6 倍以上,其他分类大致翻倍。那一个月同时产生近 9000 份工单。
公告里有一句话值得原样搬过来:在 AI 出现之前,一个独立研究者能多快产出一篇投稿,存在一个“看得出来的实际上限”,志愿审核员的工作量因此有边界。AI 工具普及之后,这个上限“现在成了可以争论的问题”。
arXiv 不做同行评审,每篇稿子上线前只做形式审核,看内容是不是学术论文、分类对不对、有没有学术价值。这套活全压在志愿者身上,他们大多是全职科研人员,用业余时间干。编辑咨询委员会主席、俄勒冈州立大学荣休教授 Thomas Dietterich 在公告里的说法很克制:一小部分作者投了大量低质量稿件,占用了不成比例的审核时间,这对认真做研究的人不公平,他们的稿子因此要多等几天甚至几周。他后来在社交平台上补了一句,有的作者一个人投了几十篇。
审核员看到的稿子长什么样,官方给了三个说法:thin papers,题目窄、内容单薄的薄论文;salami papers,把一项完整工作切成几篇分别投的香肠论文;还有大段由 AI 生成的密集稿件。香肠论文的增量极小,凑数很有效,审核起来一样要花掉一位志愿者的一整段时间。
新规矩是这样:每个提交账号每个自然月最多 2 篇,同时在审的稿子不超过 3 篇(这条 2024 年就有),覆盖全部学科,被拒的稿子照样占名额,理由很直接——消耗审核时间的是投稿这个动作,不是最终结果。留了一个口子:在论文公开之前自己删掉,不计入额度。


最微妙的一条是,名额只算在点“提交”的那个人头上,合著者不受影响。这不是偏心,是技术限制:arXiv 的作者名单是投稿时手填的,合作者要拿到论文密码、事后认领,才会跟自己的账号关联,提交的那一刻系统能确认身份的只有提交人。后果显而易见,大厂课题组换个学生提交就绕过去了,独立研究者没有合著者可以轮换,每月两篇就是硬天花板。
罗格斯大学的数学家 Alex Kontorovich 支持限投,话讲得很糙:我不会读你这个月那 42 篇论文,挑两篇,挑你最好的两篇。哈佛商学院的 Scott Kominers 投了近二十年 arXiv,反对,他的原话是 arXiv 该省的是审核成本,不是学术,配额制是在用少数人作恶惩罚所有人。最锋利的一句来自 Prachee Avasthi:每个月有多少科学进入记录,现在由人类的带宽决定,而不是由做了多少科学决定。


配额制打中的不是目标。真正批量生产香肠论文的团队有的是人手轮换提交,一个六人小组理论上一个月能挂出十二篇。被卡住的是另一群人:一个课题组六篇稿子等着会议放榜后公开,过去导师或某个高年级学生几天就能传完,现在得分给三个人,而今年 1 月起新人要自动获得提交资格,账号得绑机构邮箱、名下还得有该领域已被收录的论文,不少学生的挂名论文一直是别人代交的,轮到自己时可能连资格都没有。独立研究者的余地更小,借助大模型,一个人在短时间内做出好几个结果已经不罕见,他们没有合作者分担提交。被拒的代价跟着变大了,被拒照样占名额,据 arXiv 的审核政策,被拒或曾被搁置的提交人此后投稿会被更严格地审查,也就更容易被搁置,搁置的稿子又一直占着那三个在审名额。Hugging Face 的 Daily Papers 只收在 arXiv 上线 14 天内的论文,已经有作者因为审核拖延错过窗口。
9 月 23 日,arXiv 宣布拿到 1720 万美元捐赠,来自 Simons 基金会国际部、XTX Markets 和 Siegel Family Endowment,分三到五年到位,其中一部分明确用于开发管理 AI 生成内容的技术。工具从开发到上线要时间,志愿者的人数不会跟着钱涨。官方把这次限流叫做 stopgap,权宜之计,Dietterich 也表示希望将来能放宽甚至取消。
2026 年 7 月 1 日,arXiv 从康奈尔大学分拆成为独立非营利组织,三天后迎来首任 CEO,前《麻省理工科技评论》编辑 Penelope Lewis。这是她上任后的第一个重大决定,本质上是一次组织独立之后的立场宣示:开放不等于没有边界。前面已经连续收紧过好几轮,计算机领域的综述和立场论文要先过同行评审,新人背书门槛提高,今年 5 月还上了“一票封禁”,论文里一旦出现编造的引用或残留的模型指令,作者封一年。
这事离普通人没那么远。AI 把“产出一份像样材料”的成本压到接近零之后,所有靠质量和数量差来分层的评价体系都会失灵,论文只是第一个崩的。简历、代码审查、内容平台、客服工单,凡是默认“造一份可信材料很费劲”才设计出来的系统,都得重算一遍。arXiv 这次的应对方式,是互联网被灌水时的标准动作,先限流,因为限流是唯一一周内就能上线的办法,它买的是时间,不是秩序。
这个事情我个人觉得限流该做,它只是止血。真正的解法要在生产端做溯源和验证,代码、数据、版本历史能不能对得上,比判断一段文字像不像人写的可靠得多,1720 万美元里那笔“管理 AI 生成内容”的钱应该花在这儿。闸门安在人头上,省下的是审核员的几个小时;闸门安在生产线上,省下的才是科学的时间。