众力资讯网

Qwen3.8-Flash和千问办公在双向优化

千问办公这次标准模式,我觉得技术上比较值得看的,并非 Qwen3.8-Flash 本身有多强,而是模型和 Agent 开始双向适配了。
以前很多 Agent 产品的做法比较像:
先有一个通用大模型,再在外面套一层 Agent,让它自己规划、调工具、读上下文。但 Agent 真正跑起来以后,会产生很多和普通聊天完全不同的问题。
比如一个长任务里,模型要反复判断下一步做什么、该调用哪个工具、哪些上下文还值得保留。规划走错一步、工具多调一次、上下文多塞一截,最后都会变成 Token 和时间。
所以这次千问办公和 Qwen3.8-Flash 做的其实是两头优化。
第一头,是模型开始为 Agent 而训练。
Qwen3.8-Flash 不只是换了新架构、提高模型本身的智能密度。千问大模型团队和千问办公团队还做了联合设计,在训练阶段直接针对千问办公里的多步规划、工具选择、上下文压缩这些 Agent 任务做调优。
也就是说,它没有先训练出一个模型,再想办法塞进 Agent,而是在训练的时候就知道自己以后要怎么“干活”。
第二头,是 Agent 也反过来为模型优化。
到了推理阶段,模型团队继续做推理优化,千问办公这边则围绕模型定制 Harness。
Harness 可以理解成 Agent 真正执行任务时的“运行系统”:怎么组织上下文、什么时候调用模型、怎么衔接工具和任务步骤,都会直接影响模型到底要算多少、等多久。
所以这次省 Token,不是因为“模型变小了”。
更准确地说,是模型提高每个 Token 的智能密度,Agent 提高每个 Token 的使用效率。
一边减少模型为了完成任务需要付出的计算,一边减少 Agent 在规划、工具调用和上下文里的无效消耗。
最后反映到真实办公任务里,就是千问办公标准模式生成速度提升 1 倍,平均 Token 消耗减少 75%。
我觉得这可能也是 Agent 接下来一个挺重要的技术方向:
以前大家主要卷“给 Agent 接哪个最强模型”,以后可能越来越看模型和 Agent 到底是不是一起设计的。
毕竟真正跑一个几十步的任务时,模型强不强只是其中一部分,怎么让这份智能少走弯路、少浪费 Token,最后才决定这个 Agent 能不能被高频使用。
#大模型 #qwen3_8 #大模型分析 #千问办公