千里科技(AFARI)旗下AI研究团队 World Model Team 于2026年8月发布 BehaviorWorldGen 框架,首次系统解决了自动驾驶世界模拟器中“周围车辆不会真实反应”的结构性缺陷。该框架通过核心组件 BehaviorFlow 实现对周围车辆行为的可控生成,打通动作模型与世界模拟器的自改进闭环。该研究针对自动驾驶行业从“堆路测数据”转向“模拟器自训练闭环”的趋势,解决了闭环中的关键瓶颈。
自动驾驶动作模型(规划器、VLA模型)的训练依赖世界模拟器生成未来场景数据。但现有模拟器存在两个根本缺陷。第一,周围车辆不反应。模拟器只根据自车动作生成场景,周围车辆要么回放历史记录,要么作为生成副产物出现,不会对自车做出真实响应。一个现实中会引发碰撞的轨迹,在模拟器里可能看起来完全安全。第二,长尾场景覆盖不足。模拟器无差别地复现常规驾驶,难以生成加塞、让行、路口博弈等需要多车协调的关键交互场景,导致训练数据分布不均衡。论文指出,这有助于解释为什么稀有交互场景至今仍然难以学习。
BehaviorFlow 是整个框架的核心,是一种元动作条件的交通流模型。它为每个车辆注入可解释的帧级元动作(如保持车道、变道、转弯、掉头、旁路等),作为显式行为控制手柄。注入后,周围车辆能对自车及其他车辆做出真实响应,实现多车交互一致性。同时可按需编排稀有交互场景,将动作模型表现最差的失败案例转化为针对性训练数据。框架以结构化轨迹为模块间接口。上游兼容各类动作模型,包括端到端规划器和VLA模型;下游对接生成式世界模型和3D高斯溅射重建式模拟器。
在关键数据方面,因果模型相比双向模型推理速度提升近70倍(0.3s/帧 vs 20s/帧),同时生成质量反而更优(FID 4.36 vs 6.72)。在三种不同架构的动作模型上均实现一致提升:ChainFlow-VLA 在 NAVSIM 基准上达到 93.3 PDMS(较原始93.1提升0.2),为同类方法最高;ReCogDrive 从 86.5 提升至 87.3;DiffusionDrive 从 87.7 提升至 88.6。在最困难场景区间(PDMS