论文:EponaV2: Driving World Model with Comprehensive Future Reasoning arXiv:2605.14696 | 发表时间:2026年5月
这是 Epona 的续作。Epona 用自回归扩散世界模型"脑补"未来画面,EponaV2 则更进一步——不只预测未来图像,还同时预测未来深度图和未来语义特征图,强迫模型真正理解三维世界,并用流匹配 + GRPO 强化学习突破纯模仿的天花板。
一、论文要解决的问题
自动驾驶数据的"烧钱困境"
自动驾驶模型的训练离不开大量数据,而数据规模定律(Scaling Law)告诉我们:数据越多,模型越聪明。但问题在于,主流的感知-规划范式(Perception-Planning Paradigm)需要对每一帧画面手动标注——车在哪、人在哪、边界框、语义分割……这个过程极其昂贵,严重阻碍了数据规模化。
为此,研究者提出了无感知标注(Perception-Free)路线:完全不依赖人工标注,用预测下一帧视频图像作为自监督信号来训练驾驶模型。
但仅靠"预测下一帧"够用吗?
作者给出了明确的否定答案。
原始图像里的信息是"高度纠缠"的——深度、语义、动态全混在一起。模型只靠预测下一帧图像来学习世界,就像让人从一幅模糊的全息照片里提取精确距离,往往一知半解,规划轨迹时容易翻车。
EponaV2 的解法
受人类老司机开车方式的启发——人类会下意识感知前方物体的距离(3D 几何)和类型(语义)——EponaV2 提出:
不仅预测未来图像,还要同时预测未来深度图(3D 几何)和未来语义特征图(场景理解),强迫模型真正理解三维世界。
此外,受大语言模型 GRPO 训练方法启发,引入流匹配 + 强化学习精调轨迹规划器。
二、整体架构
历史视频帧 {I_i}
│
▼ DINO-Tok(冻结的视觉编码器)
特征序列 {F_i, ΔA_i}
│
▼ 世界模型骨干(Qwen3-VL 4B 语言部分初始化,因果注意力)
未来表示 {F'_i, ΔA'_i}
│
├──→ 流匹配规划头 v_traj ──→ 生成轨迹 x̂₀
├──→ 流匹配图像头 v_img ──→ 预测未来图像(监督用)
├──→ 轻量深度头 f_d ──→ 预测未来深度图(监督用)
└──→ 轻量语义头 f_sam ──→ 预测未来语义特征(监督用)
两阶段训练:
- 第一阶段:在 nuPlan + nuScenes 上建立世界理解能力,优化骨干 + 所有预测头
- 第二阶段:在 NAVSIM navtrain 上,冻结其他模块,只用 GRPO 精调轨迹规划头
三、世界模型骨干:输入输出的真实含义
输入输出格式
输入序列:{F₁, ΔA₁, F₂, ΔA₂, ..., F_N, ΔA_N}
输出序列:{F'₁, ΔA'₁, F'₂, ΔA'₂, ..., F'_N, ΔA'_N}
F_i:DINO-Tok 将图像编码后的视觉 token 序列,形状约为(2048, D_dino)(512×1024 图,patch size 16)ΔA_i:车辆历史运动(位移/旋转等标量),输入时是真实发生的动作- 骨干网络使用因果注意力掩码:第 i 帧的推断只能看到第 i 帧及之前的信息
F'_i 和 ΔA'_i 的物理意义
重要:ΔA'_i 不是"质量较差的动作预测"。
输入输出的时间下标是对齐的,不是错位的。ΔA'_i 是 ΔA_i 这个动作 token 经过全序列上下文融合后的隐藏状态表示,更准确地说是:
“在见到第 i 帧观测和动作之后,模型对当前世界状态理解的动作语境编码”
类比 BERT:输入"我"的输出隐状态,不是对"我"这个词的重新预测,而是在整个句子上下文下"我"的语义表示。
F'_i 同理,是第 i 帧视觉特征经过全序列融合后的隐式世界状态推断,维度与 LLM 隐藏层对齐。
真正的动作预测发生在下游:
(F'_i, ΔA'_i) → 流匹配规划头 v_traj → 采样生成 x̂₀(真正的轨迹)
为什么输出全序列 {F'_i} 而不只用 F'_N?
从信息论角度,F'_N 已经通过因果注意力 attend 到所有之前的 token,理论上包含全序列信息。推理时,只用 F'_N 做规划在信息层面是足够的。
但训练时输出全序列有重要意义:
- 对每一帧都做深度/语义/图像预测,产生 N 倍密集监督信号,大幅加速收敛
F'_i语义上是"在第 i 帧视角下对第 i+1 帧的推断",与各解码头的目标自然对齐- 骨干网络是自回归 Transformer,全序列输出是其自然范式
四、综合未来推理:深度图 + 语义图
这是 EponaV2 最核心的创新。
4.1 预测未来深度图
动机: 让模型理解 3D 几何(物体距离和空间结构),且无需推理时额外调用深度估计模型。
实现: 轻量深度头 f_d 同时输出预测深度图 d̂ 和置信度图 ĉ,伪标签由 Depth-Anything-V3 生成。
损失函数:
$$L_d = \hat{c}_{i+1}\|\hat{d}_{i+1} - d_{i+1}\|_1 - \lambda_c \log \hat{c}_{i+1} + \|\nabla_x \hat{d} - \nabla_x d\|_1 + \|\nabla_y \hat{d} - \nabla_y d\|_1$$逐项解析:
① 置信度加权绝对深度误差 ĉ·‖d̂-d‖₁
伪标签本身有噪声(天空、玻璃、远距离物体等区域深度估计失效),置信度机制让模型自己学会"哪里的标签可信":
可信区域 → ĉ高 → 损失权重大 → 认真学
噪声区域 → ĉ低 → 损失权重小 → 少学/忽略
② 防止置信度坍塌的正则项 -λ_c log ĉ
若没有这一项,模型有捷径:把所有 ĉ 预测为 0,第一项直接归零,什么也没学。-log ĉ 在 ĉ→0 时趋于正无穷,强制置信度保持在合理范围。
这两项合在一起本质上是异方差不确定性建模的最大似然估计,令 ĉ=1/σ 代入拉普拉斯分布对数似然即可精确还原。
③ 梯度误差(保证边缘清晰) ‖∇x d̂-∇x d‖₁ + ‖∇y d̂-∇y d‖₁
用一阶有限差分近似梯度:∇x d[i,j] = d[i,j+1] - d[i,j]
物体边缘处深度值突变,梯度很大。只用 L1 损失的问题:
真实深度: 2m 2m 2m 8m 8m (边缘梯度=6)
预测A: 2m 2m 5m 5m 8m (边缘被平滑)→ L1损失=6,不大
预测B: 2m 2m 2m 8m 8m (边缘保持) → L1损失=0,完美
L1 损失对"把边缘平滑掉"的惩罚不够强。加入梯度损失后:
预测A的梯度误差 = |0-0|+|3-0|+|0-6|+|3-0| = 9 ← 惩罚远更重
预测B的梯度误差 = 0
梯度损失强制模型在物体边界处保持深度突变,让边缘清晰。全部使用 L1 而非 L2,是因为 L1 对异常值(伪标签噪声)更鲁棒,不会强迫平滑。
4.2 预测未来语义特征图
动机: 让模型理解"前方那个东西是什么",定向关注驾驶中最关键的对象。
实现: 用大型分割基础模型 SAM3 生成伪标签,文字提示为 “car” 和 “human”。轻量语义头 f_sam 预测下一帧的 SAM3 特征图,损失为 L2:
通过指定文字描述,可以定向引导模型关注驾驶中最关键的对象,避免被无关信息干扰。
五、流匹配规划器:从 ODE 到 SDE 的改造
5.1 传统流匹配(ODE)在做什么
流匹配学习一个"风场" v_traj,把高斯噪声 x₁ “吹"成真实轨迹 x₀:
训练时,插值中间状态 x_t = (1-t)x₀ + tx₁,监督风场预测方向:
关键性质:ODE 是确定性的。 给定起点噪声,整条路径唯一,没有任何随机性。
5.2 为什么不能直接用 GRPO?
GRPO 需要计算"生成某条轨迹的概率”,进而计算策略梯度。但 ODE 是确定性系统:
给定起点 x₁,只有唯一路径到达 x₀
这条路径的"概率"=1,其他所有路径的"概率"=0
确定性系统没有概率分布,强化学习的策略梯度无从下手。
5.3 改造:加入随机性,变成 SDE
在 ODE 基础上加入随机扰动:
$$d\hat{x}_t = \tilde{f}(\hat{x}_t, t)\,dt + \sigma_t\,dW_t$$但不能随便加噪声——加了噪声后边际分布会改变,强化学习优化的目标就偏了。必须同时调整漂移项 f̃,补偿噪声带来的分布偏移,保证与原 ODE 边际分布等价。
5.4 推导补偿项(核心数学)
工具:Fokker-Planck 方程
对于 SDE dx = f dt + σ dW,概率密度 p(x,t) 的演化方程为:
要让 SDE 和 ODE 有相同的边际分布,两个 Fokker-Planck 方程必须等价,推导得到:
$$\tilde{f} = v_\theta + \frac{\sigma_t^2}{2}\underbrace{\nabla \log p(x_t, t)}_{\text{得分函数}}$$计算得分函数
流匹配的插值关系 x_t = (1-t)x₀ + tx₁ 意味着给定 x₀,x_t 服从高斯分布,其得分函数为:
代入并利用插值关系展开化简,最终得到:
$$\tilde{f}(\hat{x}_t, t) = \hat{x}_t \cdot \underbrace{\frac{\sigma_t^2}{2t}}_{\text{状态缩放系数}} + v_\theta \cdot \underbrace{\left(1 + \frac{\sigma_t^2(1-t)}{2t}\right)}_{\text{风场幅度调整系数}}$$这正是论文公式里两个看似神秘的系数,是由"加噪声不改变边际分布"这一约束严格推导出来的,不是凑出来的。
各项物理意义:
状态缩放项:σ²/2t · x̂_t
→ 抵消扩散噪声对状态造成的随机漂移
→ t→0时系数趋于0,靠近轨迹端修正量减小
风场调整项:(1 + σ²(1-t)/2t) · v_θ
→ 噪声削弱了风场的"有效推力",适当放大补偿
→ (1-t)在t→0时趋于1,轨迹端需要更精确的修正
若不加这两个补偿项:
加了噪声但不补偿 → 终点分布扩散、偏移
→ 强化学习优化的轨迹分布和ODE不一致
→ 训练不稳定,奖励信号失真
5.5 噪声项为什么必须是 σ_t √|Δt|?
噪声项形式为 σ_t · √|Δt| · ε,其中 √|Δt| 来自布朗运动的数学本质,不是设计选择。
布朗运动的核心性质:
随机游走 N 步,总位移的标准差正比于 √N(中心极限定理)。类推到连续情形,时间 Δt 内布朗运动增量的标准差正比于 √Δt:
如果改用 σ_t · Δt · ε 会怎样?
步长 Δt→0 时:
√Δt 项:噪声量级 ∝ √Δt(衰减慢,连续极限下保留随机性)
Δt 项:噪声量级 ∝ Δt (衰减快,比ODE项消失更快→退化回ODE)
用 Δt 代替 √Δt 会让连续极限下随机性消失,退化回原来的 ODE,GRPO 无法应用。这是伊藤积分与普通黎曼积分的根本区别。
噪声强度 σ_t = a · √(t/(1-t)) 的设计:
t→1(靠近噪声端):σ_t 大,随机性强(探索)
t→0(靠近轨迹端):σ_t 小,随机性弱(利用)
5.6 GRPO 如何利用 SDE?
有了 SDE,每一步转移变成高斯分布,路径概率可以计算:
$$\pi_\theta(\hat{x}_{t+\Delta t}|\hat{x}_t) = \mathcal{N}(\mu_\theta(\hat{x}_t,t),\ \sigma_t^2|\Delta t|I)$$GRPO 流程:
1. 用SDE采样一组轨迹 {x̂₀^g}(每次路径略不同)
2. 放入仿真器,用轨迹偏差计算奖励 r_g
(不用PDMS,因为PDMS需要人工感知标注)
3. 组内归一化:A_g = (r_g - mean(r)) / std(r)
4. 策略梯度更新:好轨迹→增大概率,坏轨迹→减小概率
5. 同时加模仿学习正则化 L_il,防止RL训练跑偏
相比纯监督流匹配的提升:
纯监督(ODE):模仿数据集中的轨迹 → 只能学到"平均水平"
SDE+GRPO: 通过试错优化执行效果 → 突破模仿的天花板
六、实验结果
主要结果
| 模型 | 感知标注 | PDMS (NAVSIMv1) |
|---|---|---|
| SafeDrive(感知派最强) | ✓ | 91.6 |
| EponaV2(ours) | ✗ | 90.4 |
| DriveLaW | ✗ | 89.1 |
| DriveVLA-W0 (Query) | ✗ | 88.4 |
EponaV2 在不使用任何人工标注的情况下,比同类无感知标注模型高出 +1.3 PDMS,在更难的 navhard 测试集上 EPDMS 提升 +5.5。
消融实验
各预测损失的贡献:
| 配置 | PDMS |
|---|---|
| 只有轨迹损失 | 84.4 |
| +图像预测 | 84.8 |
| +深度预测 | 85.2 |
| +深度+图像 | 85.6 |
| 全部(深度+图像+语义) | 86.9 |
预测未来帧 vs 当前帧:
| 预测对象 | PDMS |
|---|---|
| 当前帧深度 | 83.6 |
| 未来帧深度 | 85.2 |
预测未来比预测当前高 1.6 PDMS——“预见未来"这件事本身就对规划有额外价值,强迫模型推理"下一刻世界会变成什么样”。
GRPO 的贡献:
| 配置 | EP(自车进度) | PDMS |
|---|---|---|
| w/o GRPO | 83.6 | 89.4 |
| w/ GRPO | 84.8 | 90.4 |
EP 指标提升最显著,说明 GRPO 让车走得更远、更顺畅。
七、局限性与展望
EponaV2 目前还未超越最强的感知标注模型(91.6 vs 90.4)。根本原因是伪深度标签和伪语义标签本身有误差——Depth-Anything-V3 和 SAM3 生成的标签并非完美,用不准的标签训练存在天花板。
作者将此留给未来工作,期待 EponaV2 能启发更多探索,推动无感知标注路线走向真正的通用驾驶智能。
笔记整理自论文原文及深度讨论,覆盖架构设计、关键创新、数学推导、消融实验等核心内容。