众力资讯网

韩国AI公司Upstage把旗舰推理模型换成Solar Pro 4,Artifi

韩国AI公司Upstage把旗舰推理模型换成Solar Pro 4,Artificial Analysis智能指数从14分跳到42分,单次抬了27分。对关注大模型排名和智能体能力的开发者来说,这是值得记的节点:它已经和Inkling(xhigh)打平,只差MiMo-V2.5-Pro的43分。

涨分主要靠智能体和长文档两块短板被补上。Terminal-Bench v2.1从12%拉到57%,AA-LCR从31%拉到71%,τ³-Banking从9%拉到23%。GDPval-AA v2的Elo从498飙到1276,远超人类基线1000。原本只擅长短答的模型,现在能稳定盯长流程、长合同这类活。

强是有代价的。官方API输入、输出、缓存命中三档价格全部翻倍;平均完成一项智能指数任务的耗时从6.9分钟拉长到9.5分钟。同一次请求,钱花更多,回得更慢。定位明显偏向复杂任务,不是低成本高频调用。

也得看边界。AA-Omniscience准确率仍是19%,幻觉率24%,高于Command A+的14%与MiniMax-M3的18%,主要靠更频繁放弃作答把分拉起来。42分不是全能,是专长,更像专攻难题的资深同事,不是随叫随到的快手。

如果你的工作流主要跑智能体或长文档任务,这波+27可能比价格翻倍更值得权衡;如果更在意高频、低延迟、低幻觉,它就不是首选。