进度
路线完成度、到目标距离、平均速度。高进度可能以冒险为代价。
Lesson 05 · Evidence and evaluation
日志能大规模复现真实画面,仿真能让动作改变未来。两种评测各自切掉了一部分现实,因此一个分数从来不是驾驶能力本身。
日志中,专家车辆直行 3 秒。模型 A 预测轨迹始终比专家右偏 20 厘米;模型 B 前 2.5 秒几乎完美,最后半秒突然左偏 1 米。按平均位移误差,B 可能更小。
如果把轨迹放进真实闭环,A 也许平稳保持右侧但仍在车道内;B 可能突然撞上中央隔离带。平均误差没有描述动作执行后会发生什么。
评测的中心问题:指标观察的是“预测像不像记录答案”,还是“策略采取动作后,环境如何继续发展”?
Open-loop evaluation 在固定日志上运行模型。每个时刻的相机、目标和车辆状态来自真实记录;即使模型预测左转,下一帧仍是专家当时实际走过的画面。
它的优点是便宜、稳定、可重复,可以在大量真实传感器数据上比较模型。训练同样方便,因为专家答案已经存在。
它的根本限制是缺少策略诱导分布。模型不会真正偏离,也看不到偏离后的画面;其他车辆不会对模型动作作出反应;日志只记录了专家选择的一个未来,而现实可能有多个安全解。
设预测位置为 p̂ₜ,专家记录位置为 pₜ*:
ADE 看整段平均偏差,FDE 看终点偏差。它们适合测几何相似度,但不直接编码碰撞、规则、舒适度,也不知道另一条不同轨迹是否同样安全。
Closed-loop evaluation 把模型动作施加到车辆或仿真器。转向改变车辆姿态,车辆姿态改变下一帧图像,其他交通参与者也可能反应。
这条环会反复执行。一次小偏差可能被纠正,也可能逐步放大。
闭环能测路线完成、碰撞、交通规则和恢复能力。代价是仿真器需要生成可信的传感器与交通反应;测试更慢,也受随机种子、交通密度和场景实现影响。
| 环境 | 模型能改变自车 | 他车会反应 | 传感器来源 | 主要用途 |
|---|---|---|---|---|
| 固定日志 | 否 | 否 | 真实记录 | 大规模 open-loop |
| Non-reactive rollout | 短时近似 | 否 | 真实日志抽象 | 低成本规划指标 |
| Reactive log simulation | 是 | 规则或模型反应 | 日志与仿真混合 | 规划策略比较 |
| 全仿真 | 是 | 是 | 渲染或传感器模拟 | 闭环交互与长尾场景 |
| 真实道路 | 是 | 是 | 真实传感器 | 有限范围最终验证 |
CARLA Leaderboard 让策略在渲染城镇和交通中闭环运行,常用路线完成度、违规和综合 driving score。它适合测试恢复、交互和连续驾驶。
但仿真视觉与真实世界有 domain gap;交通行为和传感器模型是近似;排行榜可能混入不同训练数据、传感器配置与私有数据收集流程。
nuPlan 聚焦 motion planning,使用大规模真实驾驶日志,并提供 open-loop 与 closed-loop simulation。规划器通常读取结构化场景而非原始相机,所以它更适合比较规划,不等同于完整 sensor-to-plan 感知系统。
NAVSIM 试图在两端之间取折中:使用真实数据,把预测轨迹在 BEV 抽象中短时展开,计算进度、time to collision 等仿真式指标。环境不随被测策略反应,所以计算仍可大规模并行。
它比单纯 L2 位移误差更接近驾驶目标,但仍不能测其他交通参与者对自车动作的反应。论文也明确把它称为 non-reactive。
路线完成度、到目标距离、平均速度。高进度可能以冒险为代价。
碰撞、最小时距、驶出道路。碰撞稀少时置信区间很宽。
红灯、限速、停车线和逆行。规则实现细节会改变分数。
加速度、jerk、横向加速度。过度保守也可能很平滑。
综合分数需要权重或乘法规则。例如路线完成度与违规惩罚相乘,一次严重违规可能让长路线分数骤降,导致高方差。只报均值而不报分布、场景数与失败类型,会隐藏模型到底哪里变好了。
Bench2Drive 使用 CARLA v2,把 cut-in、绕行、超车等交互能力拆成短场景,并提供统一训练数据。它试图减少长路线随机性,也让失败能归到具体能力。
场景化评测仍是仿真评测。它改善可比性和诊断性,不消除 domain gap。
OpenDriveLab 仓库特意链接了 CARLA Garage 的 benchmarking mistakes。读实验表时至少检查下面八项:
“SOTA”只对指定数据、协议、指标和版本成立。跨表格复制一个数字,常常已经失去可比条件。
| 证据 | 能支持的结论 | 不能直接支持 |
|---|---|---|
| 离线轨迹误差下降 | 更接近日志中的专家轨迹 | 闭环更安全、偏离能恢复 |
| 离线碰撞 proxy 下降 | 在固定未来假设下更少几何冲突 | 其他参与者反应后的安全性 |
| 仿真闭环分数上升 | 在该仿真协议中驾驶更好 | 真实道路同幅度提升 |
| 多个场景和种子稳定 | 结果不只来自少数随机路线 | 未测试长尾也可靠 |
| 有限真实道路测试 | 指定区域和条件下可运行 | 开放世界普遍安全 |
好的论文会让结论停在证据覆盖范围内。你的任务不是找一个完美指标,而是组合不同证据,知道每一层还缺什么。
模型 A:nuScenes 上 3 秒轨迹 ADE 更低,离线碰撞率 proxy 更低;只运行一次闭环短测试。
模型 B:ADE 略高;在 44 类交互场景、五个随机种子中路线完成度更高,真实感仿真碰撞更少;传感器与训练数据和 A 相同。
请回答:
把答案发给我,可以一起区分“数字更高”和“证据更强”。