
隔了几天,一家叫 Graphite 的营销公司交出一份字典,13000 条。
做法不复杂。研究团队先找了一万篇 ChatGPT 发布之前的文章当人类对照组,然后让几个前沿模型仅凭摘要重写这些文章。这一步是关键:只给摘要,等于把选题、用材、原始措辞全挡在外面,对比剩下的就只有用词和句式,不会变成“模型选了个别的题造成的差异”。最后筛出 13000 个在 AI 文本里出现频率至少是人类两倍的短语,Graphite 把这类东西叫 tell,口语里就是“破绽”。

单词 dependable(可靠)比人类多用 23 倍。“this matters”(这一点很重要)多用 116 倍。“why X matters”(为什么某件事重要)多用 92 倍。句式上它已经不用“它不是 X,它是 Y”这个被公开点过无数次的旧毛病了,换成了它的近亲——“它不只是一个 X,它是一个 Y”。改掉了旧疤,长出了新疤,位置还差不多。
Astra 爱说某个话题的“另一个维度”,爱用“may provide”“can provide”这种和缓语气。最突出的被 Graphite 叫作“纠偏式表达”——先说“它不单纯是 X”,再说“而不是依赖于 X”。这类结构在 Astra 写的文本里,比人类文稿多了一百倍以上。
以前人人都能一眼认出 AI 写作有个标志:句子中间夹一个长破折号。现在这个标志快被剿灭了。Opus 5.5 比 Opus 5 少用 99%,Astra 比人类基线少用 88%,谷歌的 Gemini 3.1 Pro 几乎把这个符号从自己的输出里清干净了。那个被当成 AI 标志的动词 delve,也基本绝迹。过去那套“看破折号加生僻词”的经验手册,一夜之间作废了。
Graphite 首席 AI 官 Greg Druck 对 TechCrunch 说的原话是:这些特征并没有在减少。他们成功去掉了最有名的那些,但新的会冒出来。每个模型版本都有自己的。这家公司的研究还看出一个分裂:Claude 系列每一代都在往人类的词频分布上靠,GPT 系列在持续偏离。同一家实验室的两条产品线,一个在装得像人,一个越来越像自己。
Druck 的解释很实在:这些是有数十亿参数的大模型,他们能跑的测试是有限的,总会有东西漏出来。这句话放在编程里人人懂——你测了一万个用例,剩下那一条漏了,就等着它上线那天爆。语言也一样。禁掉一百个具体词,不等于禁掉一整类结构。禁用词表能压住某个说法,压不住“倾向”。它更像训练落在词选上的统计残留,不是一个能拧回零的旋钮。
还有一层得替这项研究说句公道话,它的实验设计有个边界:让模型照摘要重写,一次交活。真实的工作流不是这样。人是让AI先写,自己再改一遍。改过之后指纹会被稀释,句式会跟着人的习惯走。也就是说,实验室里测出来的 116 倍,和你实际收到的一篇文章之间,还隔着一个人的手。这大概能解释一件怪事:词典都一万三千条了,为什么从没见哪篇文章因为这个被大规模揪出来。
字典要跟着模型版本不停重训,每个版本换一批词,检测器就得跟着重写一遍规则。这是一场防守永远在追一个刚移动过去的目标的军备竞赛,字典的半衰期大概是几个月。往前看更实用的判断是,别把“AI 味”当成判决。116 倍是相对人类基线算出来的,而绝大多数读者对人类基线并不熟悉。写东西本来就拗口、喜欢用对照句的真人作者,被这套词表扫进去的概率并不低。风格强烈的人一直被怀疑在用AI,这事很早就有了。

学生和写手最直接:交出去的作业、投出去的稿子,可能一眼就被认出来。我把几条最扎眼的摆出来自查——“这一点很重要”、“为什么这事重要”、“它不只是一个 X,它是一个 Y”、“不只是……而是……”、“一个维度”、“而不是依赖于”。这几条你数一数自己的稿,中两条以上就有点悬。自媒体人看的是另一头,平台和读者开始按“AI 味”给内容定价,写得太像,掉的是信任。打工人最容易忽略的是这一层:邮件、周报、季度总结,正在被无形标注,老师和HR面前那点差别,可能就是这几个词。开发者拿到的是一份永远不会完工的活——检测工具的字典要跟着模型版本不断重训,这条赛道没有终点。
我觉得字典追不上模型,这不怪谁笨。检测的价值也不在抓人,在提醒——一份AI腔的稿子里,最先被读出来的永远是那套句式,而不是观点。真正的损耗在这儿:所有人都开始用同一套转折句说话,久而久之,读者听见的就不再是字面意思。
回去翻翻自己最近发的东西,数一数那六个短语出现了几次,评论区报个数字。