众力资讯网

字节跳动的豆包大模型又更新了。这次是 Doubao-Seed-2.1-pro 的 0915 版本,API 已经在火山方舟全量上线,主要面向企业级的实际生产场景做了一轮大升级。我看完觉得有几个点挺值得聊聊的。 先说 Agent 做任务这块。大家知道 AI Agent 最怕的就是「一本正经地胡说八道」,也就是幻觉问题。这次更新在搜 ​

字节跳动的豆包大模型又更新了。这次是 Doubao-Seed-2.1-pro 的 0915 版本,API 已经在火山方舟全量上线,主要面向企业级的实际生产场景做了一轮大升级。我看完觉得有几个点挺值得聊聊的。

先说 Agent 做任务这块。大家知道 AI Agent 最怕的就是「一本正经地胡说八道」,也就是幻觉问题。这次更新在搜索可信度上下了功夫,模型会去找权威来源,会判断信息是不是过时了,还会交叉核验数据。他们拿了一个金融投研的例子来展示:模型要核实某车企财报里的一个说法,直接调度了 500 多个子 Agent,检索了 1000 多个网页,把海事船舶航迹、当地招聘信息、卫星影像这些不同来源的信息拿来交叉比对,不采信单方通稿,最后出了一份每个结论都能追溯到具体证据的尽调报告。这个做法已经很接近专业分析师的工作方式了。

再说写代码的能力。这次模型能看懂大型代码仓库了,跨文件找问题、定位原因、完成修复,整个流程能跑通。他们拿一个叫 Luanti 的开源游戏项目做了测试,这个项目有大概 38.7 万行代码和 1000 个历史 Issue,模型连续跑了将近 36 个小时,最终 83% 的修复任务达到了可以合并的标准。更有意思的是多模态和代码能力的结合:给模型一段操作录屏加几张手画草图,它就能给一个没有文档的老 ERP 系统开发移动端页面,背后是读懂了 28 万行 Java 代码。设计稿直接变成了能跑的程序。

然后是多模态理解的提升。视频方面,模型现在能在视频里找证据、把不同帧的信息串起来推理。3D 和专业图文方面进步也很明显,CAD 工件、游戏引擎里的 3D 元素都能识别,工程图纸上的尺寸标注、财报里的表格提取精度都提高了。他们展示了一个案例:仅凭 4 张设计图,模型就还原出了一个带风雨霜雪四季变化的可交互 3D 庭院场景。

最后说说成本。能力变强的同时,Token 消耗反而降了,图像和视频推理的 Token 用量比上一代减少了 30% 以上。接入方式上有两个选择:用 Doubao-Seed-2.1-pro-0915 可以锁定当前版本,用 Doubao-Seed-Evolving 则不用换接口就能自动用上最新模型。