众力资讯网

AI会做题,却还不太会科研,最强Agent只完成30%的真实科研任务 AI在数学

AI会做题,却还不太会科研,最强Agent只完成30%的真实科研任务
AI在数学竞赛和各种标准测试里越来越厉害,但真把它放进科研工作中,差距一下就出来了。
斯坦福大学研究人员参与推出的 Terminal-Bench-Science 0.1,拿出了70个来自生命科学、物理、地球科学、数学和工程领域的真实科研任务。不只是答题,还包括数据分析、模拟、定理证明、图像重建和模型拟合。
目前表现最好的 Claude Opus 5 配合 Claude Code,也只完成了30%的任务,GPT-5.6 Sol 配合 Codex 为22.4%,后面的不少模型甚至不到10%。
这些任务来自研究人员的科研流程,最后交付的也不是选择题答案,而是分析结果、模拟、证明、代码和数据等真正能被检查的成果。
团队最初收到了920个任务提案,经过科学性、难度和可验证性等筛选,最终只有70个进入首版榜单,也就是说整套测试专门找现阶段AI不容易解决的问题。
所以30%不能理解成AI只有三成科研能力,但至少说明了一件事,AI会做难题,和AI能够独立处理真实科研工作,中间还有一段不短的距离。