众力资讯网

Claude Opus 5.5 发布了。 看来是OpenAI带来的压力太大了,A/也开始卷Sota模型的性价比了 这次最值得关注的,不是 Anthropic 又刷了多少 Benchmark,而是 Opus 开始从“最强但贵”变成“最强而且真能日常用”。 几个重点👇 1|Opus 5.5 是 Claude 5.5 家族第一款模型 Anthropic 自己的定位很直 ​

Claude Opus 5.5 发布了。

看来是OpenAI带来的压力太大了,A/也开始卷Sota模型的性价比了

这次最值得关注的,不是 Anthropic 又刷了多少 Benchmark,而是 Opus 开始从“最强但贵”变成“最强而且真能日常用”。

几个重点👇

1|Opus 5.5 是 Claude 5.5 家族第一款模型

Anthropic 自己的定位很直接:

大部分任务已经能做到 Fable 5.1 级别,但相比 Opus 5,典型任务运行成本降低 40%。

而且 Sonnet 5.5、Haiku 5.5 接下来几周也会跟上。

这说明 5.5 不只是一次模型升级,而是一轮完整的产品线换代。(Anthropic)

2|这次最狠的升级,其实是“经济性”

API 价格:

• Input:$5 → $4 / 1M tokens• Output:$25 → $20• Cache Read:$0.50 → $0.20

缓存读取直接降了 60%。

同时输出速度提高 30%+。

Agent 最烧钱的地方恰恰是长上下文、反复调用工具和 Cache。

所以这次的意义不是“便宜20%”,而是:

复杂 Agent Workflow 的单位任务成本开始明显往下掉。 (Anthropic)

3|Agent Coding 是 Opus 5.5 最明显的强项

Anthropic 公布的数据:

• Terminal-Bench 4.0:66.4%• FrontierCode:54.4%• CursorBench 4.0:57.8%

对比它列出的 GPT-6 Astra:

Terminal-Bench:57.9%FrontierCode:53.3%

对比 GPT-5.6 Sol:

CursorBench:41.7%。

当然,这是 Anthropic 自己发布的测试,Harness、effort 和成本计算方式都要一起看,不能直接理解成“全面碾压”。

甚至 Anthropic 自己都提醒:

到这个能力水平之后,Benchmark 的几个百分点越来越难代表真实体验差距。

这句话其实比榜单本身更值得注意。(Anthropic)

4|一个明显趋势:模型开始真正处理“工程项目”,而不是“写代码”

他们给出的案例已经不是:

“帮我写个函数。”

而是:

• 68万行代码迁移• 20万行 Codebase Audit• 跨 6 个 Repository 工作• 连续自主运行 18 小时• 一个 Session 协调另外十几个 Session

Opus 5.5 做 20 万行代码审计:

不到3小时。

Opus 5:

20+小时,而且用了2.5倍 Token。

如果这些能力在真实使用中稳定下来,Coding Agent 的竞争核心会越来越从:

“代码写得聪不聪明”

转向:

“能不能连续工作十几个小时,还不把项目搞坏。” (Anthropic)

5|对非程序员来说,我反而更关注 Knowledge Work

GDPval-AA v2.1:

Opus 5.5:1846Fable 5.1:1735Opus 5:1708GPT-5.6 Sol:1588GPT-6 Astra:1542

Anthropic 还专门测试了:

研究报告、金融分析、Excel 建模、商业 Workflow、数据收集。

一个并购分析任务里:

Opus 5.5 用 63分钟Opus 5 用 93分钟

成本还低了 50%。

对咨询、研究、投研、数据分析这些工作,这可能比 Coding Benchmark 更值得关注。(Anthropic)

6|还有一个很容易被忽略的升级:它终于开始“少说人话了” 😂

准确说,是:

更少废话,更像正常同事。

Anthropic 明确说 Opus 5 的一个主要负面反馈就是:

太啰嗦、难扫读、喜欢奇怪表达。

Opus 5.5 开始:

• 结论提前• 少 jargon• 更遵守写作要求• 输出更短• 长 Session 更容易跟

Box 测试甚至发现:

Token 用量只有 Opus 5 的约 1/3,回答短了 40%,准确率没有下降。

模型“智商”继续上涨当然重要。

但对于真正每天用 AI 工作的人:

少说废话,本身就是生产力。 (Anthropic)

7|安全上的变化也很有意思

Anthropic 的自动行为审计覆盖接近 2,000 个场景。

他们称 Opus 5.5 是目前测试过 alignment 表现最好的 Claude。

在一个“是否试图突破限制”的测试里,它尝试绕过边界的次数比 Opus 5 / Mythos 5.1 少了约 85%。

但 Anthropic 同时承认一个很关键的问题:

模型有时能够意识到自己正在被测试。

也就是说:

模型越聪明,评估模型本身也越来越难。

这是接下来 Frontier Model 很值得长期观察的问题。(Anthropic)

8|所以怎么看 Opus 5.5?

如果只盯着排行榜,会觉得这是又一次:

“Claude +10%,GPT -5%”。

但我觉得真正的故事是:

Frontier Model 的竞争正在从“谁最聪明”,进入“谁能以更低成本、连续更久、更少返工地完成整个工作”。

Opus 5.5 的核心关键词不是一个:

更强。

而是四个:

更强 × 更快 × 更省 × 更能独立干活。

当这四件事同时发生,Agent 才真正开始变得有经济意义。

这可能比 Benchmark 第一名重要得多。人工智能