一篇读懂 BEV 感知:自动驾驶的「上帝视角」是怎么算出来的

视角即难题:八个摄像头,八个不同的世界

一辆自动驾驶车通常环布 6-8 个摄像头:前视、侧视、后视……每个摄像头拍到的都是透视图——近大远小,同一辆卡车在侧视镜里可能只占几十个像素。传统的感知方案是每个相机独立跑 2D 检测,再用后处理把结果拼起来。这条路有两个结构性痛点:跨视角关联(前视看到的车尾和侧视看到的车身,怎么知道是同一辆车?)与尺度不一致(同一个目标在不同视角下像素大小天差地别,检测器的置信度没有可比性)。相机越多,拼接的补丁越难打。

BEV(Bird's-Eye-View,鸟瞰视角)感知的思路是一次釜底抽薪:不要在各自视角里分别理解图像,而是把所有相机的特征统一变换到一张俯视的 2D 网格里,在这张「上帝视角」的地图上做检测、分割、跟踪。在 BEV 空间里,所有目标共享同一坐标系与同一尺度,跨视角关联从「难题」变成了「不存在」——多相机融合天然完成。代价是变换本身要算得准:哪里看错几厘米,规划就错几厘米。BEVFormer 论文(ECCV 2022)的动机表述就是这句话:从多相机图像学习统一的 BEV 表征,让一个表征同时服务 3D 检测与在线建图。

两条通往鸟瞰的路:显式深度与注意力

从透视图到鸟瞰图的变换,本质是「每个图像像素对应三维空间中哪条射线」的问题。学术界给出了两条代表性路线。

LSS(Lift-Splat-Shoot,ECCV 2020)走显式深度估计:对每个像素不猜一个深度,而是预测一个深度概率分布(「这个像素在 5 米、6 米、7 米处的可能性分别是多少」),把整张图像沿射线「举起」(lift)成一堆带深度的视锥特征,再全部「泼洒」(splat)到俯视栅格里累加。名字里的第三段「Shoot」常被忽略:得到 BEV 代价图后,用它给模板轨迹打分选出规划输出——2020 年的这篇论文已经把「感知到规划」的闭环画好了。它的好处是可解释、对相机标定误差相对鲁棒,发布后成了 BEV 研究的基准底座。

BEVFormer(ECCV 2022,被引超 3000 次)走注意力路线:预先在自车周围铺一张 BEV 查询网格,网格里的每个位置通过空间交叉注意力(Spatial Cross-Attention)去各相机图像里「查询」与自己对应的特征——网格位置先按几何关系投影到各相机的成像平面,只关注投影落点附近的图像区域,既省算力又保证几何一致性;再用时序自注意力融合上一帧的 BEV 特征。效果有硬数字:nuScenes 测试集上 56.9% NDS,超过此前最佳 9 个百分点,达到与激光雷达方法相当的水平,速度估计与夜间低可见度目标的召回尤其提升明显。

工业界的标志性节点是 Tesla:2021 年 8 月的 AI Day 上,Tesla 公布了 8 相机视频流经 Transformer 注意力融合成统一 BEV 向量空间的方案,同时宣布去掉高精地图与激光雷达、用 4D(空间+时间)自动标注替代人工——把论文界的共识变成了量产路线图,也直接引爆了此后三年的 BEV 军备竞赛。

鸟瞰之上的任务栈:从检测到 Occupancy 再到端到端

BEV 空间本身只是「坐标系」,真正的任务栈在上面逐层展开:BEV 检测(车辆、行人)、BEV 分割(可行驶区域、车道线)、跟踪与运动预测,最终输出给规划器。这条栈上有一个关键的结构升级——Occupancy Network(占用网络)。

Tesla 在 2022 年 9 月的 AI Day 上提出的方案:不再问「这个区域是什么类别」(车?行人?),而是把空间切成体素,直接预测每个体素被占据的概率与流动方向(flow)。动机是传统检测的「本体论裂缝」:道路上总有不在类别表里的东西——侧翻的卡车、掉落的家具、悬挂的塑料布,检测器遇到它们等于失明;占用网络把问题改成「这里有没有东西、它在怎么动」,通用障碍物由此被覆盖。这个设定随后引发了学术界的视觉 3D 占用预测研究浪潮。

任务栈的终点是端到端:UniAD(《Planning-oriented Autonomous Driving》,CVPR 2023 最佳论文,商汤与 OpenDriveLab 团队)用统一的 query 机制把检测、跟踪、建图、运动预测、占用预测、规划六个模块串进一个网络,以「规划导向」设计每一层的目标,在 nuScenes 上拿下规划任务的 SOTA——BEV 感知从「感知模块」进化成了「驾驶系统的底座」。

三代关键工作放在一起看,演进逻辑一目了然:

工作 年份 回答的问题 关键动作
LSS 2020 怎么到鸟瞰? 显式深度分布 + 栅格泼洒
BEVFormer 2022 怎么变好? 注意力查询 + 时序融合
Occupancy / UniAD 2022-2023 还缺什么? 体素占用通用障碍 / 全栈端到端

时序融合:鸟瞰图的「第四维」

BEV 还有一个常被低估的优势:时序融合的天然载体。因为同一张网格跨帧对齐,把上一帧的 BEV 特征对齐到当前帧(按自车运动补偿平移)再融合,就能同时提升两类关键能力:速度估计(单帧无法判断静止与运动,多帧位置差直接给出速度——Fast-BEV 的作者提醒过,激光雷达检测器早就在用多帧融合拿速度,视觉 BEV 补上了这课)与遮挡恢复(上一帧看得见的目标,这一帧被挡住了,记忆还在)。代价也要如实说:运动补偿假设是「自车动、世界静止」,对横穿的行人这类动态目标会拖出「鬼影」,更精细的方案要按目标的 flow 做运动感知补偿——这也是为什么 BEV 论文里 flow 预测总是与占用预测成对出现。

从论文到车规:算力与无图化

BEV 变换(尤其注意力式)是算力大户,落地的第一道门槛是车规芯片。NVIDIA DRIVE Orin 是上一代智驾的算力基准:254 TOPS(ASIL-D 安全等级),奔驰、蔚来、沃尔沃等一众车型搭载。但引用 TOPS 有一个行业内的著名口径陷阱——254 TOPS 是 GPU、DLA、PVA 多单元在稀疏计算下的合计峰值,实际可用的算力要打折,而且 BEV 类负载往往先撞内存带宽而不是 TOPS 墙。参考量级:轻量化的 BEV 方案(如 Fast-BEV)论文声称可在 Orin 约 22 TOPS(不含 DLA)的预算内部署,全量 BEVFormer 级别的模型则要到下一代芯片(Thor 之类)才宽裕。

第二道门槛是高精地图的退场。早期 BEV 方案常与高精地图配合,但地图采集与更新的成本让城市扩张难以为继。2024 年起中国厂商集体转向「重感知轻地图」:华为 ADS 2.0 以 BEV+GOD(通用障碍物检测)实现无图城市 NOA(2023 年三季度落地 15 城、四季度 45 城),理想 2024 年 7 月推送「全国都能开」的无图 NOA,小鹏走 XNET 重感知路线。感知在线重建 BEV,地图只留作先验——这个转变把 BEV 从「锦上添花」变成了「必需品」。到 2026 年,这一代架构已经完成向端到端的交接:华为 ADS 4 宣称端到端时延降 50%、通行效率升 20%,2026 年预计搭载 50 余款车型;Momenta 的强化学习大模型 R6 于 2025 年三季度量产,2026 年北京车展又发布了 R7 强化学习世界模型;地平线 HSD 2.0 于 2026 年 6 月开启 OTA,一段式端到端叠加世界模型与强化学习,截至 2025 年末已拿到 10 家车企、20 余款车型的定点——BEV 表征仍是底座,决策层换成了端到端网络。

争议:端到端会取代 BEV 吗

端到端路线崛起后,「BEV 过时了吗」成了行业争论。本文的判断(标注为作者观点):不是取代,是收编。端到端网络依然需要一个空间表征来组织多相机信息,BEV 就是那个被验证过的表征——UniAD 的端到端正是构建在 BEV 序列上,华为、地平线的端到端方案同样保留了 BEV/Occupancy 底座。真正的争论在别处:一段式端到端(图像直接到轨迹)与分段式(感知-规划分明)之争、纯视觉与融合激光雷达之争。反方观点也值得一听:有从业者认为二三十亿参数级的视觉语言模型并不擅长输出精确的轨迹控制量,「融合激光雷达的端到端可能胜过纯视觉、分段式优于一段式」——这些路线之争尚无定论,但无论哪边赢,多相机到统一空间的变换都是共同的底座。

小结

BEV 感知的故事是「视角决定难题」的教科书案例:透视图把同一辆车拆成八个矛盾的投影,BEV 用一次坐标变换让矛盾消失。LSS 用显式深度、BEVFormer 用注意力把变换做成可学习的模块,Occupancy 用体素概率绕开「这是什么」的分类死结,端到端把整条任务栈收进一个网络——每一步都是在前一步的坐标系上换问题。对工程者,这个案例的启示或许更普适:当多源数据怎么都对不齐时,先怀疑「坐标系」,而不是急着在每个数据源上打补丁。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?