现在的端到端自动驾驶系统,很多都依赖于模仿学习(Imitation Learning, IL),也就是像个新手司机一样,学习人类专家的驾驶数据。但这种方式有个明显的瓶颈:模型只会死板地模仿,开起车来总是显得过于“保守”和“单一”,在真实世界的复杂路况下,泛化能力和决策多样性就捉襟见肘了。
为了打破这种“模仿僵局”,来自北京交通大学、地平线等机构的研究者们提出了一个名为 DIVER 的全新端到端自动驾驶框架。它的核心思想,是将强化学习(Reinforcement Learning, RL)与基于扩散的生成模型(Diffusion-based Generation)巧妙地结合起来,旨在生成既多样又安全可行的行驶轨迹。

论文标题:DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving
作者:Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo
机构:北京交通大学,地平线,南洋理工大学,澳门大学,澳大利亚昆士兰大学
论文地址:https://arxiv.org/abs/2507.04049
代码仓库:https://github.com/adept-thu/diver
传统的端到端自动驾驶模型,无论是早期的单轨迹预测,还是后来为了增加多样性而出现的多模态轨迹预测,其本质都是在模仿一个“标准答案”——也就是人类专家提供的那条唯一的真值(Ground-Truth, GT)轨迹。

这就像教一个学生解题,每次都只给他一个标准解法。久而久之,他只会背答案,遇到变种题型就傻眼了。在自动驾驶中,这种模式会导致“模式崩溃”(Mode Collapse)问题:即使是像DiffusionDrive这样采用扩散模型的方法,由于训练目标仍是无限逼近那条GT轨迹,模型生成的多条轨迹最终还是会扎堆在一起,缺乏真正的多样性,无法覆盖现实中可能出现的多种合理驾驶选择(比如是超车还是减速让行)。
DIVER的整体架构非常清晰,它由一个感知模块和一个运动规划模块组成。其真正的创新之处在于训练范式和规划器的设计。

策略感知的扩散生成器 (Policy-Aware Diffusion Generator, PADG)
为了从根源上增加多样性,DIVER不再仅仅依赖单一的GT轨迹。PADG在生成轨迹时,会从一条GT轨迹中衍生出多条参考轨迹,这些参考轨迹蕴含了不同的驾驶意图,比如变道、让行、超车等。

然后,模型在去噪和生成新轨迹的过程中,会同时以地图元素、周围智能体以及这些多样化的参考轨迹作为条件。这相当于告诉模型:“看,面对这种情况,有好几种开法,你都学学。” 这样一来,模型就能学会生成覆盖多种可能性的轨迹,而不是只盯着一个标准答案。
强化学习“老司机”在线指导
有了多样的轨迹候选还不够,还需要保证这些轨迹是安全的、合理的。DIVER在这里引入了强化学习,把扩散模型的生成过程看作是一个随机策略。它使用了组相对策略优化(Group Relative Policy Optimization, GRPO)算法来指导扩散过程。
具体来说,DIVER设计了几个关键的奖励函数(Reward Function)来对生成的轨迹进行打分和优化:

通过优化这些奖励,强化学习就像一位经验丰富的老司机,不断对扩散模型生成的“新手轨迹”进行点评和修正,引导它产出既多样又安全、舒适的驾驶策略,从而有效规避了碰撞风险并提升了真实感。
为了验证DIVER的实力,研究者们在多个主流的自动驾驶评测基准上进行了大量实验,包括闭环测试平台 NAVSIM 和 Bench2Drive,以及开环测试数据集 nuScenes。
全新的多样性度量衡
值得一提的是,为了更准确地衡量预测的多样性,论文还提出了一个新颖的多样性度量(Diversity Metric)。该指标通过计算不同预测轨迹之间的平均距离,并根据轨迹的整体尺度进行归一化,从而能更公平地评估模型生成行为的丰富程度。
闭环与开环测试结果
在闭环仿真平台NAVSIM上,DIVER在多个关键指标上都取得了领先,例如无碰撞率(NC)、驾驶能力(DAC)和时间-碰撞(TTC)指标。

在开环的nuScenes数据集上,DIVER的表现同样亮眼。从下表可以看到,DIVER在各个时间尺度(1s, 2s, 3s)上的多样性指标(Div.(t))均大幅领先于MomAD、DiffusionDrive和SparseDrive等前沿方法,平均多样性达到了0.21,相比基线提升了约40-60%。同时,其平均碰撞率(Col. Rate)是所有对比方法中最低的,仅为0.07%。

研究者还对模型的鲁棒性进行了测试,例如在转弯场景(Turning-nuScenes)和恶劣天气条件(nuScenes-C)下,DIVER都展现出了更强的稳定性和安全性。

可视化对比
数据显实力,眼见更直观。下面的可视化结果直观地展示了DIVER与DiffusionDrive、SparseDrive在不同场景下的表现差异。
在NAVSIM的可视化中,无论是避让、路口转弯还是跟车场景,DIVER(绿色轨迹)明显生成了比DiffusionDrive(蓝色轨迹)更多样化且合理的轨迹簇。

在Bench2Drive的可视化中,DIVER同样展现了其强大的多样化轨迹生成能力。

这项工作告诉我们,人类给出的“真值”并不一定是学习的最优目标,在一定约束下的适度发散性探索,也许可以赋予机器学习系统更好的表现。
值得一提的,作者已经公开了代码,感兴趣的朋友可以进一步探索:
https://github.com/adept-thu/DIVER