Lesson 05 · Evidence and evaluation

怎么判断它真的会开

日志能大规模复现真实画面,仿真能让动作改变未来。两种评测各自切掉了一部分现实,因此一个分数从来不是驾驶能力本身。

预计 35–45 分钟 Open-loop ↔ Closed-loop 含 4 道即时题

先看一个反直觉例子

日志中,专家车辆直行 3 秒。模型 A 预测轨迹始终比专家右偏 20 厘米;模型 B 前 2.5 秒几乎完美,最后半秒突然左偏 1 米。按平均位移误差,B 可能更小。

如果把轨迹放进真实闭环,A 也许平稳保持右侧但仍在车道内;B 可能突然撞上中央隔离带。平均误差没有描述动作执行后会发生什么。

评测的中心问题:指标观察的是“预测像不像记录答案”,还是“策略采取动作后,环境如何继续发展”?

1. Open-loop:下一帧不会被你的动作改变

Open-loop evaluation 在固定日志上运行模型。每个时刻的相机、目标和车辆状态来自真实记录;即使模型预测左转,下一帧仍是专家当时实际走过的画面。

固定日志 texpert observation
模型预测predicted trajectory
与专家比较ADE · FDE · collision proxy
固定日志 t+1ignores model action

它的优点是便宜、稳定、可重复,可以在大量真实传感器数据上比较模型。训练同样方便,因为专家答案已经存在。

它的根本限制是缺少策略诱导分布。模型不会真正偏离,也看不到偏离后的画面;其他车辆不会对模型动作作出反应;日志只记录了专家选择的一个未来,而现实可能有多个安全解。

技术补充:ADE 与 FDE

设预测位置为 p̂ₜ,专家记录位置为 pₜ*

ADE = (1 / T) Σₜ ||p̂ₜ − pₜ*||₂ FDE = ||p̂_T − p_T*||₂

ADE 看整段平均偏差,FDE 看终点偏差。它们适合测几何相似度,但不直接编码碰撞、规则、舒适度,也不知道另一条不同轨迹是否同样安全。

2. Closed-loop:动作会回来找你

Closed-loop evaluation 把模型动作施加到车辆或仿真器。转向改变车辆姿态,车辆姿态改变下一帧图像,其他交通参与者也可能反应。

当前观测oₜ
策略aₜ = π(oₜ)
环境转移sₜ₊₁ ~ P(sₜ,aₜ)
下一观测oₜ₊₁

这条环会反复执行。一次小偏差可能被纠正,也可能逐步放大。

闭环能测路线完成、碰撞、交通规则和恢复能力。代价是仿真器需要生成可信的传感器与交通反应;测试更慢,也受随机种子、交通密度和场景实现影响。

闭环也有不同真实性

环境模型能改变自车他车会反应传感器来源主要用途
固定日志真实记录大规模 open-loop
Non-reactive rollout短时近似真实日志抽象低成本规划指标
Reactive log simulation规则或模型反应日志与仿真混合规划策略比较
全仿真渲染或传感器模拟闭环交互与长尾场景
真实道路真实传感器有限范围最终验证

3. CARLA、nuPlan 与 NAVSIM 分别切了哪里

CARLA:完整可交互仿真

CARLA Leaderboard 让策略在渲染城镇和交通中闭环运行,常用路线完成度、违规和综合 driving score。它适合测试恢复、交互和连续驾驶。

但仿真视觉与真实世界有 domain gap;交通行为和传感器模型是近似;排行榜可能混入不同训练数据、传感器配置与私有数据收集流程。

nuPlan:真实日志上的规划与仿真

nuPlan 聚焦 motion planning,使用大规模真实驾驶日志,并提供 open-loop 与 closed-loop simulation。规划器通常读取结构化场景而非原始相机,所以它更适合比较规划,不等同于完整 sensor-to-plan 感知系统。

NAVSIM:真实日志与非反应式短时展开

NAVSIM 试图在两端之间取折中:使用真实数据,把预测轨迹在 BEV 抽象中短时展开,计算进度、time to collision 等仿真式指标。环境不随被测策略反应,所以计算仍可大规模并行。

它比单纯 L2 位移误差更接近驾驶目标,但仍不能测其他交通参与者对自车动作的反应。论文也明确把它称为 non-reactive。

4. 一个分数通常混合了多种能力

进度

路线完成度、到目标距离、平均速度。高进度可能以冒险为代价。

安全

碰撞、最小时距、驶出道路。碰撞稀少时置信区间很宽。

合规

红灯、限速、停车线和逆行。规则实现细节会改变分数。

舒适

加速度、jerk、横向加速度。过度保守也可能很平滑。

综合分数需要权重或乘法规则。例如路线完成度与违规惩罚相乘,一次严重违规可能让长路线分数骤降,导致高方差。只报均值而不报分布、场景数与失败类型,会隐藏模型到底哪里变好了。

Bench2Drive:按能力和短场景拆开

Bench2Drive 使用 CARLA v2,把 cut-in、绕行、超车等交互能力拆成短场景,并提供统一训练数据。它试图减少长路线随机性,也让失败能归到具体能力。

场景化评测仍是仿真评测。它改善可比性和诊断性,不消除 domain gap。

5. 常见的错误比较

OpenDriveLab 仓库特意链接了 CARLA Garage 的 benchmarking mistakes。读实验表时至少检查下面八项:

  1. 训练数据是否相同:更多路线、天气或教师质量会盖过架构差异。
  2. 传感器是否相同:Camera-only 与 Camera + LiDAR 不能只看最终分数。
  3. 是否用了特权输入:训练教师可用不等于部署策略可用。
  4. 路线和地图是否泄漏:测试城镇、路线或场景模板可能出现在训练中。
  5. 评测版本是否相同:CARLA 版本、Leaderboard 规则和交通管理器会变化。
  6. 随机种子是否充分:一次运行不能代表高方差闭环分数。
  7. 失败是否被平均:均值可能掩盖少数致命碰撞。
  8. 指标实现是否一致:碰撞阈值、轨迹采样和坐标系差异会改变数字。

“SOTA”只对指定数据、协议、指标和版本成立。跨表格复制一个数字,常常已经失去可比条件。

6. 读实验的证据阶梯

证据能支持的结论不能直接支持
离线轨迹误差下降更接近日志中的专家轨迹闭环更安全、偏离能恢复
离线碰撞 proxy 下降在固定未来假设下更少几何冲突其他参与者反应后的安全性
仿真闭环分数上升在该仿真协议中驾驶更好真实道路同幅度提升
多个场景和种子稳定结果不只来自少数随机路线未测试长尾也可靠
有限真实道路测试指定区域和条件下可运行开放世界普遍安全

好的论文会让结论停在证据覆盖范围内。你的任务不是找一个完美指标,而是组合不同证据,知道每一层还缺什么。

即时检查

题 1 · Open-loop 最大的结构限制是什么?

题 2 · NAVSIM 属于哪种折中?

题 3 · 长路线综合分数为什么高方差?

题 4 · 跨论文比较前最先对齐什么?

迁移练习:两张实验表,选谁

模型 A:nuScenes 上 3 秒轨迹 ADE 更低,离线碰撞率 proxy 更低;只运行一次闭环短测试。

模型 B:ADE 略高;在 44 类交互场景、五个随机种子中路线完成度更高,真实感仿真碰撞更少;传感器与训练数据和 A 相同。

请回答:

  1. 如果目标是闭环城市驾驶,你更信哪一个?为什么?
  2. A 的离线结果仍能说明什么?
  3. B 还缺哪两种证据,才能把结论扩大到真实道路?
  4. 如果 A 使用额外 LiDAR,而 B 只用相机,结论怎么改?

把答案发给我,可以一起区分“数字更高”和“证据更强”。

本课压缩

  1. Open-loop 可扩展、可重复并使用真实日志,但策略动作不会改变未来输入。
  2. Closed-loop 能测错误反馈和恢复,结果又依赖仿真真实性与随机性。
  3. CARLA、nuPlan、NAVSIM 测试的系统边界不同,不能只比较最终数字。
  4. 综合分数混合进度、安全、合规和舒适度,必须查看分项与失败分布。
  5. 证据有适用范围:离线结果、仿真闭环和真实道路测试互相补充,不能互相冒充。

首选资料与选读

  1. 首选:Common mistakes in benchmarking逐项对照以后读到的 CARLA 论文。
  2. NAVSIM读摘要,写出它保留了 open-loop 的什么,又加入了 simulation 的什么。
  3. Bench2Drive关注 short clips、interactive scenarios 和 long-route variance。
  4. nuPlan devkit用官方文档确认 planner 输入、scenario 与 simulation 指标。