这段时间,我观察到行业里出现了一个很有意思的变化。
在过去,我们评价一个大模型的能力,主要看的还是跑分、榜单这些。
但今年6月,OpenAI发布的一项研究里提到,当月有超过70%的Codex用户,都曾把原本需要人类工作一小时以上的任务交给AI。
「Agent正在把知识工作的基本单位,从一次对话变成被委托的长程任务。」
METR近期也提出了一个类似的指标,它不只统计模型答对多少题,而是把任务换算成人类专家原本需要投入的时间,再看AI能以多高的成功率完成。
换句话讲,AI真正的能力单位,正在从答对多少题,变成到底能连续工作多久。
1当然,我们说的AI连续工作,肯定不是让它在聊天框里思考一小时,或者故意让用户等得更久。
真正重要的,是模型能不能接住一个复杂任务,并在中途不断处理新情况。
我们可以对标我们人类现实里的工作。
现实里人类处理任务,其实很少有做一步就直接结束的,写一篇文章可能会遇到来源冲突,做一个网页也可能出现代码报错。
这也是为什么长上下文不等于长程执行。
上下文很长,只能说明模型可以装下更多信息。但至于它能不能记住目标,出错之后又能不能接着做,又是另一回事。
假设一个模型每一步都有99%的成功率,当任务增加到50步时,完整跑通的概率也只有约61%。
很多Agent并不是不会做某一步,而是在漫长的过程中逐渐偏离了目标。
2在这个背景下,我们来分析蚂蚁百灵刚发布的Ling-3.0-flash,就会发现它最值得关注的点并非参数大小。
这款模型有124B总参数,每个Token只激活约5.1B参数。这就像是一家公司拥有很多部门,但每次接到任务时,只让真正相关的人参与。
这种设计保留了较大的能力容量,同时降低了每一步推理的计算量。
对普通聊天来说,省下一点算力或许没有那么明显;可一旦模型连续调用工具,运行几十个步骤,单步成本就会被不断放大。
5.1B激活参数真正对应的,不只是快一点,而是复杂任务能不能以可接受的成本持续运行。
3官方还提到,Ling-3.0-flash还针对Agent做了专门优化,在超过一万个可交互环境中进行了训练,也引入了对完整执行轨迹的复盘。
模型需要从工具反馈和失败记录中继续学习,而不是只对照一道题的标准答案。
比如,下面这个Blender自动化建模的demo,就是一个很直观的例子。
用户只给出一句需求,Ling-3.0-flash需要先通过Blender MCP进入软件,再编写Python脚本,把高架道路和摩天大楼逐渐搭建起来。
场景基本完成后,它还要处理材质,设置摄像机路径,最后渲染出一段航拍视频。
而且这个场景最困难的地方在于,前一步改变了场景,后面的操作就要根据当前状态继续推进。
遇到结果和预期不一致时,Ling-3.0-flash还得理解软件给出的反馈。
这和在聊天框里一次性写出一段代码完全不同,因为模型需要接触一个会不断变化的环境,也需要为最后的结果负责。
长程执行能力,真正要解决的就是这种过程。
4当然,大部分人肯定也不会每天让AI在Blender里建一座城市。
真正贴近日常的变化,是我们交给AI的任务会慢慢变长。
比如在办公场景下,我们想准备一份立项方案,手上可能只有几份凌乱的草稿和一张预算表。
过去,我们需要先调整Word里的标题层级,再检查Excel公式,最后还要把两边的内容重新汇总。
但接入Office MCP以后,Ling-3.0-flash可以直接打开这些文件。
它会整理提案格式并生成目录,遇到预算数据时,也能继续核对SUMIF公式和透视表。处理完成后,再输出一份规范文档和方便查看的PDF长图。
模型的价值不再只是少写几段文字,更实际的衡量方式是,任务交出去以后,人还要回来接管几次。
5所以未来的AI,到底会变成一个大而全的模型,还是由很多模型一起工作?
我的判断是,用户看到的入口会越来越统一,但系统内部会更像一个组织。
Ling-3.0-flash采用的MoE,本身已经是一种模型内部的专家分工。
到了外部,通用模型还可以根据任务调用专业模型,必要时再安排多个Agent合作。
比如我们可以看下面这个自主科研大盘的案例。
拿到一个研究课题后,Ling-3.0-flash会把提出假设、搜索文献、分析数据和整理成果交给不同角色,过程中还安排了交叉验证者,专门质疑现有证据。
如果发现某个结论站不住脚,就会把问题退回去重新讨论,最后再生成论文和演示文稿。
当然,这也并不意味着Agent越多越好。
真正有效的协作,还要看不同角色有没有带来新的信息,以及它们能不能发现彼此的问题。
因此,未来真正成熟的AI系统,未必会把所有问题都交给最强模型。它更需要判断什么时候自己完成,什么时候再寻找帮手。
下一阶段最有竞争力的模型,可能不只要在一分钟内给出聪明答案,还要在一个小时后记得用户最初要什么,并把事情可靠地做完。







