众力资讯网

让 agent 先商量几轮再迈步

点开是冲着标题里的 denoising,想看扩散那套怎么搬进多智能体寻路(MAPF,一群 agent 在同一张图上各走各的路还不能撞)。

看完觉得它指出的问题比方法更值得记住:每个 agent 的动作分布都学对了,各自抽样,合起来照样出错。

例子是一条窄走廊,两个 agent 要对穿。专家数据里一半是蓝先走,一半是红先走,单看每个 agent 就是五五开。各抽各的,四种组合各占四分之一,一起等就卡死,一起走就撞上。LC-MAPF、MAGAT+、HMAGAT 实测有效动作都在 50% 左右。作者还证明了这块误差靠加模型容量消不掉,问题出在最后那一步独立抽样上。

DMM 的做法是让每个 agent 先随机给一个动作意图,塞进消息里和邻居交换几轮,再落子,有点像去噪。训练只用 4 轮,测试拉到 8 轮,走廊里有效率从 94.8% 涨到 99.6%,两种让法都还保留着 😮

MovingAI 上 1600 个任务解了 1598 个,这个要打点折扣,靠了 CS-PIBT 防撞,那一步是中心化的,论文自己也承认。

我们组几个代码 agent 并行改仓库,老是撞在同一个文件上。打算让它们先互发两轮意图再动手,看冲突能少多少。

论文:https://arxiv.org/pdf/2609.32019
代码:https://github.com/CognitiveAISystems/DMM

#人工智能 #论文 #强化学习 #深度学习 #机器人马拉松