3D视觉工坊很荣幸邀请到加州大学尔湾分校计算机系在读博士生谢少远,为大家着重分享他们团队的工作:
Are VLMs Ready for Autonomous Driving?An Empirical Study from the Reliability, Data, and Metric Perspectives
论文:https://arxiv.org/abs/2501.04003
Code & Demo:https://drive-bench.github.io/
Dataset & Benchmark:https://huggingface.co/datasets/drive-bench/arena
直播大纲
本次分享介绍 DriveBench,一个专为自动驾驶设计的视觉语言模型(VLMs)基准测试框架,旨在评估VLMs在不同环境和任务下的可靠性。DriveBench 涵盖感知、预测、规划和行为四大核心任务,并引入 15 种OoD类型,以系统性测试 VLMs 在复杂驾驶场景中的可靠性。DriveBench 的研究发现当前 VLMs 在视觉信息缺失或受损情况下仍能生成“合理”但缺乏视觉支撑的回答,暴露出数据偏差和评估指标的局限性。为提升 VLMs 在自动驾驶中的可信度,研究提出 Robust Agentic Utilization(RAU) 框架,利用 VLMs 的OoD感知能力,引导外部去噪模型增强感知稳健性。RAU 方案不仅改善了 BEV 目标检测模型在复杂场景下的表现,也为未来更可靠、可解释的自动驾驶决策系统提供了新的思路。
1.自动驾驶中的视觉语言模型(VLMs)概述
2.DriveBench: 自动驾驶VLMs的可靠性基准
3.VLMs 可靠性评估分析
4.提升VLMs在自动驾驶中的可靠性
5.未来展望与应用前景