众力资讯网

Artificial Analysis 在 8 月 12 日放出 AA-Anal

Artificial Analysis 在 8 月 12 日放出 AA-AnalystAgent 榜单,专门测 AI 智能体处理真实电子表格与文档中的分析任务。结果是 Claude Opus 5(max)54% 第一,GPT-5.5(xhigh)50% 第二,Claude Fable 5 49% 第三,开源侧的 Kimi K3 以 39% 居首。

这张榜的看点是 pass^5:每道题跑 5 次,必须 5 次全对才算过。单次答对率只看运气,pass^5 把稳定性拉到与正确率同等位置——偶然蒙对、平时翻车的模型全被打回原形。一道现金流建模题,这次算对、下次忘了加折旧,对真实工作就是无效输出。

榜单共 80 道题,覆盖 14 个商业与科学领域,包含五类工作流:来源检索与诊断、筛选与汇总、比率与趋势分析、P&L 建模、现金流与估值建模。智能体运行在开源框架 Stirrup 上,换模型和复现结果都有据可查。

前两名只差 4 个百分点,数字贴身,但放到 pass^5 标尺下,贴身比的是真实可用性,不是抽签运气。Kimi K3 39% 距头部仍有 10 到 15 个百分点,开源智能体在能力上限和稳定输出两端都还有空间,但已站上与闭源同台比较的位置。

榜单未披露其余模型位次、pass@1 与 pass^5 的具体差值,以及 80 道题的评分细则,完整方法论有待 Artificial Analysis 后续公布。

把"每次都对"作为门槛后,分析师级 AI 的差距,与其说是能力高下,不如说是稳定复现的工程问题。

你最想让 AI 智能体先上手哪类活儿——P&L 建模、行业数据检索,还是敏感性测算?