8月14日晚间,千问办公悄悄干了件事。上线两款新模型,智谱的GLM-5
8月14日晚间,千问办公悄悄干了件事。上线两款新模型,智谱的GLM-5.3和DeepSeekV4Pro,用户在产品首页的“前沿模型”档位就能直接选。加上之前接入的阿里自家Qwen3.8-Max,千问办公手里现在攥着三家模型厂商的牌。阿里、智谱、DeepSeek,同台了。这事单看不大,放进时间轴里就有味道了。腾讯的WorkBuddy、字节的TRAEWork、百度的库库AI,都在走多模型聚合这条路。现在阿里也进来了。办公Agent这个赛道,四家互联网巨头,算是正式站到了同一条起跑线上。看到这,你可能想问,阿里自己有Qwen,为什么要接别人家的模型?问得好。这恰恰是整件事的关键。以前大厂做AI产品,思路都差不多,自家模型打天下,肥水不流外人田。可办公Agent这个场景有点特殊。一项复杂任务,往往需要连续完成好多步骤,查资料、写代码、做表格、生成长文档。问题来了,没有哪个模型样样第一。有的代码强,有的长文本猛,有的响应快,有的便宜。DeepSeekV4Pro这次主打100万Token上下文、最高384K输出,长程任务和Agent任务串联是强项。GLM-5.3呢,重点强化编程和复杂工程任务。各吃各的饭,各干各的活。只绑定一个模型,就像让同一个员工既写方案又修打印机又跑外勤。能干活,但样样都不精。所以聚合路线的道理很朴素,让最合适的模型干最合适的活。不过,模型装得越多,另一个麻烦跟着来了。到底该让谁干活?目前千问办公的做法,还是让用户自己选。复杂方案、自动化工作流,选“前沿模型”;快速调研、表格分析这种轻活,用便宜的“经济模型”。说白了,把选择题丢给了用户。可用户真的分得清吗?大多数人连Token是什么都懒得搞懂,你让他判断这个任务该用GLM还是DeepSeek?这就引出了下一个词,路由。理想状态下,用户只管提需求,后台的Agent自动调度。简单的信息提取,派给速度快、成本低的模型;代码和复杂推理,交给能力强的。用户从头到尾不需要知道背后是谁在干活,就像你打车不需要研究司机的驾龄。这一层要是做成了,价值可不小。对个人用户,直接关系任务效果、等待时间、积分消耗。到了企业场景,那就是实打实的算力开支。选错模型,钱花得冤枉;选对了,省下的都是利润。再往深想一层,还有个更大的想象空间。每一次真实任务,都会留下模型表现的反馈。什么任务交给哪个模型成功率高,耗时多久,烧多少Token,哪个环节容易翻车。这些数据攒多了,反过来又能优化路由策略。当然,前提是隐私、授权、数据治理都合规。你发现没有?这里藏着一个挺微妙的身份转变。办公Agent平台,本来是模型的“客户”,花钱买模型能力。可一旦用户规模足够大、任务数据足够多,平台手里就有了评判模型的裁判权。谁的模型在真实场景里表现好,数据说了算。模型厂商想被多调度、多调用,就得在人家的地盘上拿出真本事。卖方慢慢变成了被挑的那一方。这个攻守易位,值得咂摸。当然,现在还没到那一步。这场竞争还在很早期,行业里连基本问题都没吵明白。什么时候该切模型?按单次请求调度,还是按一整段任务调度?都没有统一答案。路由这玩意听着美,做起来全是坑。切换太频繁,任务上下文丢失;切换太迟钝,成本和效果双输。我的判断是这样,分三层说。短期内,拼的是接入数量和稳定性。谁家模型全、调用顺、不翻车,谁就能留住尝鲜的用户。这一阶段门槛不高,四家都能玩。中期,拼的就是路由的真功夫了。调度策略聪不聪明,直接决定成本曲线和用户口碑。到那时候,手动选模型会像手动挡汽车一样,变成少数极客的爱好。长期看,真正的护城河是任务数据。谁的平台跑过的真实办公任务多,谁的路由就越来越准,形成滚雪球。模型会越来越像水电煤,可替换;而握着调度权和数据的平台,更像电网,难搬走。有个细节我觉得是风向标。千问办公这次把DeepSeek摆在首页,阿里系产品给外部模型导流,搁两年前难以想象。围墙正在拆,不是谁变大方了,是单模型撑不起Agent时代的野心。模型越造越多,这是上半场的故事。下半场的较量,才刚刚开场,比的是谁更懂得用模型。会造刀的很多,会使刀的不多。