技术巡猎 比亚迪自动驾驶看到前方红灯,你能确定这个红灯管的是哪条车道吗?这个问题听起来比较基础,但恰恰是自动驾驶落地时比较头疼的一块。路口的信号灯、地上的标志线、路边的限速牌,它们之间并不是孤立的。红灯到底约束哪几条车道?右转箭头灯只影响右转车道还是也管直行车道?这些”谁管谁”的问题,不搞清楚是要出事的。
比亚迪这份专利(2025101093158),就是在解决这个关联问题。它的核心思路其实比较直接,就是让AI学会判断交通目标和车道目标之间的对应关系。交通目标就是信号灯、标志牌这些,车道目标就是地面上划分出来的各条车道。两者之间的匹配关系,用术语说叫”关联检测”。
现有的做法大概分三派,各有各的毛病。一是靠逻辑规则硬写,if-then语句堆叠。红灯亮则所有车道停车,这种规则在简单路口还能跑,一遇到复杂立交、辅路汇入口、可变车道,规则库就爆炸了。二是靠高精地图,把每条车道对应的信号灯信息提前标注好。问题在于高精地图的成本比较夸张,更新周期也长,一个新路口的信号灯变了,地图数据可能一个月后才同步。这期间的空窗期,自动驾驶就相当于蒙眼开车。还有就是走端到端路线,摄像头画面直接进神经网络,黑盒一头扎进另一头,关联关系全靠模型自己悟。悟对了算运气,悟错了连错在哪都不知道,出事了没法追溯,这对于安全关键系统来说基本不可接受。
比亚迪的方案比较务实,走了一条中间路线,关系矩阵监督学习。训练的时候,数据标注员不只是标出”这里有信号灯”“这里有车道线”,还要额外标注它们之间的关联关系。某个信号灯和某条车道有关,标1,无关,标0。这些0和1组合起来,就构成了一张关系矩阵。这张矩阵不是推理出来的,而是人工标注好的,直接作为监督信号喂给模型学习。
就是让模型在训练阶段就明确知道正确答案是什么,而不是让它自己猜。模型的架构设计也比较有意思。输入是一张普通图像,先过CNN做特征提取,把画面里的信息压缩成高维特征图。然后呢,这些特征兵分两路,一路用自注意力机制生成交通目标的特征表示,另一路用交叉注意力机制生成车道目标的特征表示。
自注意力比较好理解,就是让模型自己去看画面里哪些地方像信号灯、像标志牌,把注意力集中在这些区域。交叉注意力的作用则是让交通目标和车道目标之间产生信息交互,模型在判断一个信号灯的时候,会同时参考周围车道的信息,这样关联判断就比较准确。
最后一步是构建一个二分图。左边节点是交通目标,右边节点是车道目标,边上面标注的是关联概率。模型输出的是一个概率值,比如某个信号灯和某条车道的关联概率是0.85,那就说明这条关系比较可信。整个二分图一目了然,你可以逐条检查每一条关联关系,哪里不对一眼就能看出来。
这就是可解释性的来源。黑盒模型你没法拆开看,但二分图摆在这里,每个关联都有概率支撑,调试起来就踏实多了。关联类型也被细分为三种。管辖关系是最直接的约束,红灯约束直行车道,这就是管辖。引导关系更偏向指示作用,比如前方右转标志牌告诉你这条车道通往匝道,但不构成硬性约束。警示关系则是提醒性质,比如前方事故多发路段的提示牌,你看到就行,不需要改变行车行为。这种分类的意义在于,不同类型的关联直接影响自动驾驶的决策逻辑。管辖类关联必须严格遵守,引导类关联用于路径规划参考,警示类关联则是风险预警。分类越细,决策就越有针对性。
这套方案最大的优势有三个。不依赖高精地图。普通摄像头的画面加上标注好的训练数据就够了,数据更新成本低得多,新路口的信号灯配置变了,重新标一批数据训一轮模型就行,不需要等地图厂商慢悠悠地更新底图。
泛化能力比较强。关系矩阵本质上是让模型学习一种关联模式,而不是死记硬背某个路口的配置。训练数据覆盖的场景越丰富,模型在新路口的表现就越好。规则系统做不到这一点,因为新场景意味着要写新规则。
最重要的还是可解释。二分图把关联概率摊开给你看,Debug的时候能定位到具体是哪条边出了问题。安全团队做审核的时候,也能逐条验证关联结果是否合理。这在自动驾驶的监管要求越来越严的大背景下,是比较关键的一个竞争力。
从技术路线来看,比亚迪这套方案没有走极端。既不是堆规则也不是纯黑盒,而是用监督学习给模型一个方向感,让模型在明确的监督信号下学习关联判断,同时保留了推理过程的可查看性。这种折中路线在工程落地时通常更靠谱,因为极端方案要么维护成本太高,要么不可控。
自动驾驶的技术栈正在从堆硬件、堆传感器的阶段,转向精细化理解场景的阶段。谁能在细节上把”谁管谁”这样的基础问题解决好,谁的系统就多一层安全冗余。


