众力资讯网

AI改祖传屎山代码,最高只对4成 我看到一份刚引发讨论的 AI 编程评测,结果挺

AI改祖传屎山代码,最高只对4成
我看到一份刚引发讨论的 AI 编程评测,结果挺能解释现实里的落差:

让模型写一个新 Demo 很快;让它进公司的老项目改计费、税费或迁移,最高通过率只有 38.8%。

Real-SWE 用的是 10 个来自私有生产代码库的真实任务,每个模型与工具组合重复跑 8 次。排名第一的组合通过率 38.8%,第二名 33.8%;其中 6 个任务的平均通过率低于 15%。

难点不是语法,而是公司自己的常识:哪些旧行为不能破、哪些业务规则藏在多个服务里、改完怎么证明没有伤到别处。参考答案中位数要改 11 个文件。

更反常识的是,跑得久也没明显更可靠:10 分钟内结束的任务有 71.4% 失败,运行更久的有 73.4% 失败。评测方认为,漏需求和错误假设比时间不足更常见。

AI编程 程序员 开发者工具 AIAgent howto用好AI codex AI不焦虑howto howto入门codex 大模型