众力资讯网

Coding Agent 界的 MoE 来了 Devin Fusion 性能打平 Claude 和 GPT-6 Astra

Cognition 公司在 9 月 11 日发布了一个新东西——Devin Fusion。 简单说:它把 AI 芯片领

Cognition 公司在 9 月 11 日发布了一个新东西——Devin Fusion。
简单说:它把 AI 芯片领域的 MoE(Mixture of Experts)架构搬到了编程 Agent 领域。
MoE 是什么?就是"不信任单一模型的第一答案",让多个模型协作干活。大芯片公司早就这么干了——一个任务分给不同的计算单元。现在,编程 Agent 也开始这么干了。
Devin Fusion 的架构很简单:一个前沿主模型 + 一个成本高效副模型。
主模型负责复杂推理,副模型处理低成本任务,分工协作。
结果呢?性能打平 Claude Fable 5.1 和 GPT-6 Astra 单模型,成本直降 43%。
今天就来聊聊,Devin Fusion 到底是个什么玩法,值不值得你换。
不信任第一答案:MoE 架构进入编程 Agent传统的编程 Agent 是怎么工作的?
你给它一个任务,它用一个大模型(比如 Claude 或 GPT)生成代码,然后提交。一锤定音,成不成看模型。
Devin Fusion 不一样。 它用两个模型协作:
前沿主模型(Lead): Claude Fable 5.1 或 GPT-6 Astra,负责复杂推理和关键决策。成本高效副模型(Sidekick): Cognition 自研 SWE-2(medium),定价 $0.75/Mtok,负责简单任务和辅助工作。打个比方: 以前的编程 Agent 像一个高级工程师——什么事都他干,贵但靠谱。Devin Fusion 像一个团队——高级工程师负责核心架构,助理工程师负责写测试、查文档、跑验证,便宜且高效。

核心逻辑是:不是所有任务都需要旗舰模型。 你让 Claude Fable 5.1 去写一个单元测试,就像让厨师帮你热一杯牛奶——能热,但没必要。
性能数据:独立基准测试说话Artificial Analysis 是独立 AI 基准测试机构,他们发布的 Coding Agent Index v1.5 是目前最权威的编程 Agent 评测。
关键数据:
配置
Coding Agent Index
完成率
平均成本
平均时间
Claude Fable 5.1 + SWE-2
62
56%
$7.90
35.8 分钟
GPT-6 Astra + SWE-2
59
50%
$4.54
24.7 分钟
Codex (GPT-6 Astra max)
62
56%
$7.47
29.4 分钟
三个关键发现:
第一,性能打平。 Claude Fable 5.1 配置得分 62,跟 Codex(GPT-6 Astra max)并列第一。GPT-6 Astra 配置得分 59,仅低 3 分。
第二,成本优势明显。 GPT-6 Astra 配置比 Claude Fable 配置便宜 43%(7.90),完成任务快 31%(24.7 分钟 vs 35.8 分钟)。
第三,效率更高。 Devin Fusion 比其他 Harness 效率高 39%。
副模型选择对比:
副模型
定价
Fusion 性能
成本
GPT-5.6 Luna
$0.20/Mtok
62.0
$2.39
SWE-2 (medium)
$0.75/Mtok
63.4
$2.34
SWE-2 单价是 GPT-5.6 Luna 的 3.75 倍,但整体成本反而低 2%,因为效率更高。 这意味着 Cognition 的副模型虽然贵,但干得快、干得好,综合下来更省钱。
两种配置怎么选?Devin Fusion 支持两种主模型配置:
Claude Fable 5.1 + SWE-2:
性能最高(62 分)完成率最高(56%)成本较高($7.90/任务)适合:复杂项目、对质量要求高的场景GPT-6 Astra + SWE-2:
性能略低(59 分)成本最低($4.54/任务)速度最快(24.7 分钟)适合:日常编码、快速迭代、成本敏感场景我的建议:
如果你是个人开发者,选 GPT-6 Astra 配置。 59 分已经很高了,比大多数 Codex 配置都强。成本只有 $4.54,速度快 31%,性价比最高。
如果你是技术负责人,选 Claude Fable 5.1 配置。 62 分最高性能,56% 完成率最高。虽然贵一点,但复杂项目值得投入。

不管选哪个,都比单模型方案省钱。
对开发者的实际价值Devin Fusion 对开发者意味着什么?
1. 省钱。 GPT-6 Astra 配置比 Claude Fable 便宜 43%。如果你一周跑 100 个编码任务,用 Fable 要 ,用只要454。一个月省 $1,344。
2. 省时。 Astra 配置比 Fable 快 31%。24.7 分钟 vs 35.8 分钟,差 11 分钟。看起来不多,但如果你一天跑 20 个任务,一天省 3.6 小时。
3. 性能不打折。 59-62 分,打平 Claude 和 GPT-6 Astra 单模型。你没为省钱牺牲性能。
4. 双端支持。 Devin Desktop + Devin CLI,图形界面和命令行都能用。
打个比方: 以前你用编程 Agent,像是在"开豪车"——性能好但贵。现在你用 Devin Fusion,像是在"开混动"——性能差不多,但省油一半。
写在最后Devin Fusion 的发布,标志着编程 Agent 从"单模型时代"进入"多模型协作时代"。
MoE 架构在 AI 芯片领域已经证明了它的价值——不依赖单一计算单元,分工协作,性能更强、功耗更低。
现在,这个逻辑被搬到了编程 Agent 领域。
不信任单一模型的第一答案,让多个模型协作干活——这不只是技术升级,更是思维方式的转变。
省钱、省时、性能不打折——Devin Fusion 把这三件事同时做到了。
对开发者来说,没有理由不试试。