点云Token化之困:激光雷达能否搭上端到端大模型的快车?

一、引言:激光雷达在端到端驾驶中的角色演变

端到端自动驾驶的目标,是让神经网络直接从传感器输入(摄像头、激光雷达等)映射出驾驶决策,绕过传统模块化架构中感知、决策、规划、控制层层传递的繁琐流程。激光雷达(LiDAR)凭借其精准的3D空间感知能力,在这场变革中扮演着越来越关键的角色。

从技术演进来看,端到端自动驾驶大致经历了三个阶段:模仿学习(IL)主导期强化学习(RL)探索期,以及当下正在发生的大模型(Foundation Model)赋能期。激光雷达在这三个阶段中的角色,也从一个“可选的3D补充”逐步走向“多模态大模型的核心数据源”。


二、模仿学习时代:激光雷达作为“空间增强器”

模仿学习的核心逻辑很简单:让模型观看大量人类专家的驾驶数据,学会“照葫芦画瓢”。早期端到端系统多以纯视觉为主,但很快研究者发现,仅靠RGB图像难以应对复杂的三维空间推理。

TransFuser是这一阶段的标志性工作之一。它首次将Transformer的自注意力机制引入图像与LiDAR的融合——通过多分辨率Transformer模块,将透视图与鸟瞰图(BEV)特征进行融合。实验表明,相比纯几何融合方案,TransFuser将每公里的平均碰撞次数减少了**48%**。这一成果证明:在复杂城市场景中,LiDAR提供的精确3D信息与图像的语义信息可以形成有效互补。

BEVDriver则更进一步,它将多视角图像和3D LiDAR点云通过BEV编码器统一转化为潜在空间中的BEV特征,再经由Q-Former对齐后输入大语