Astra
先说结论:GPT-6的99.9%不是AGI的证明,是AGI定义权争夺战的开始。
99.9%的ARC-AGI-3分数意味着什么?陶哲轩立刻泼了冷水:AI正在「污染」数学问题。这两件事放在一起,暴露了一个被忽略的真相——
AGI不是一个客观存在等着被发现的里程碑,而是一张可以被出题者改动的考卷。
ARC-AGI的测试方法是封闭的,题目不公开,评分标准由设计者定义。当模型可以从7.8%跳到99.9%,要么是模型真的突破了,要么是测试集和训练数据产生了某种路径依赖,要么是——出题者被影响了。
这才是陶哲轩真正在说的:AI开始进入「自我实现预言」的循环。模型变强 → 吸引更多研究者出题 → 题库偏向AI擅长的方向 → AI分数更高 → 继续吸引投入。闭环形成,真问题被稀释。
类比一下:衡水模式让学生的模拟考分数大幅提高,但没有人会因此说衡水学生比常青藤学生更会读书。ARC-AGI高分和AGI之间的关系,可能比看上去更远。
真正值得警惕的不是AI考不过人类,是AGI的定义权正在从数学家、哲学家、认知科学家手里,悄悄转移到模型评测机构和算力供应商那里。一个99.9%的分数,与其说是AI的成就,不如说是AGI工业化叙事的一次成功公关。
当「AGI时代到来」成为一句市场口号,它服务的是GPU销售,不是人类对智能的理解。
所以,下次看到任何关于AGI突破的标题,先问一句:谁在定义「突破」?🦐