logo
登录 / 注册

BEVFormer v2:让新型图像主干网络在BEV感知中发挥强大能力|论文解读

头像
上海人工智能实验室
23-06-29 ·

近年来,新型的图像主干网络凭借更优的结构和更大的规模,在一般的2D视觉任务上取得了显著提升。然而,现有的鸟瞰视角(Bird’s-Eye-View, BEV)感知模型仍局限于特定的3D预训练主干网络,未能发挥新型主干网络的强大能力。将通用的2D图像主干网络应用于BEV感知存在两个难点:一是普通图像与自动驾驶场景存在较大的差异;二是BEV感知模型的复杂结构导致主干网络无法得到充分监督和优化。


为了克服 2D图像主干网络适配BEV感知任务 的难点,上海AI实验室联合清华大学、商汤科技共同提出一种新的BEV物体检测器:BEVFormer v2。与现有BEV模型不同,BEVFormer v2在主干网络上增加一个相机视角检测头,用于 引入相机视角下的监督信号(Perspective Supervision)以辅助优化主干网络(Backbone) ,并将该检测头与BEV检测头组合为二阶段检测器。BEVFormer v2在nuScenes数据集3D物体检测任务上的表现超越了现有SOTA模型,同时,本研究提出的Perspective Supervision能泛化到各类图像主干网络。

论文标题: BEVFormer v2: Adapting Modern Image Backbones to Bird’s-Eye-View Recognition via Perspective Supervision

论文链接:http://arxiv.org/abs/2211.10439


亮点速览

•在nuScenes 3D物体检测任务上达到NDS 63.4,mAP 55.6,相比之前的SOTA提升了2.4 NDS和3.1 mAP。


•所提出的perspective supervision在不同的图像backbone上均能带来约3.0 NDS、2.0 mAP的显著提升。


Perspective Supervision应对传统模型局限

鸟瞰视角(Bird’s-Eye-View,BEV)感知模型是当前自动驾驶领域常用的多视角感知模型。它通过2D到3D的视角转换和特征融合,将多视角的图像特征综合为鸟瞰视角下统一的BEV feature,并在BEV feature上搭建不同的检测头完成各类下游任务。

图1:BEV感知模型框架。现有方法主要关注BEV feature的构建和使用,本文则关注图像backbone和feature
目前,BEV感知模型多聚焦于从图像特征到BEV Feature构建与BEV Feature使用,而较少关注BEV模型中的Backbone。当前较常使用的Backbone基于3D任务预训练生成,然而3D预训练较为繁琐、开销巨大,导致已有的预训练Backbone性能有限。本文则从Backbone这一角度出发,旨在为BEV感知提供更好的图像Feature,提升BEV模型的性能。
近年来,CNN、Transformer结构等新型2D图像Backbone发展迅速。这些模型凭借更优的结构设计和更大的规模,在一般2D感知任务上取得了显著的性能提升。
在BEV感知中发挥新型Backbone的强大能力,面临的挑战是:
1. 普通2D图像与自动驾驶的3D场景存在较大的差异。2D图像backbone在一般的2D视觉任务上训练,缺少自动驾驶场景中特定的3D知识。

2. BEV感知模型的复杂结构导致主干网络优化困难。由于构建BEV feature时进行了相机视角到BEV视角的转换和attention机制采样,来自BEV的监督信号在向backbone传导时被扰乱。

图2:BEV supervision与Perspective supervision的对比。Perspective supervision对backbone的监督更为直接充分

为了将2D图像Backbone适配到BEV感知模型,论文提出引入相机视角下的监督信号(Perspective supervision)来解决上述问题。相机视角下的3D Head根据图像Feature直接预测物体,能提供更直接、更丰富的监督信号,帮助Backbone的场景适应和优化。


三项创新重塑传统模型结构

图3:BEVFormer v2的整体框架

BEVFormer v2的整体结构如上图所示,包括Backbone、Perspective Head以及由spatial encoder、temporal encode、DETR decoder组成的BEV Head。相比原先的BEVFormer,本研究修改和新增的设计有:

1.Perspective loss:来自perspective head的辅助loss引入perspective supervision

2.Ravamped temporal encoder:更好地利用long-term时间信息

3.Hybird object query:将两个detection head组合为一个二阶段检测器


Perspective Loss

研究团队首先分析了BEV感知模型的潜在问题,明确额外添加Perspective supervision的必要性。BEV模型首先利用相机视角到BEV视角的转换和attention机制构建BEV Feature,随后在BEV坐标下进行物体的预测和计算Loss,但导致监督信号在向Backbone传导时被扰乱,因此Backbone得不到充分的监督和优化,无法有效提取3D信息。
传统方法使用特定的3D预训练Backbone,使得这一缺陷得到一定程度弥补。而当应用新型的2D图像Backbone时,Perspective supervision成为解决这一问题的关键。在Backbone上增加一个相机视角检测头(Perspective Head),直接根据图像Feature预测物体并计算Loss,能为Backbone提供大量直接的监督信号。
图4:perspective loss来自perspective head,作为一项辅助loss
如上图所示,BEVFormer v2在图像backbone上搭建了两个head:perspective head和BEV head。这两个head一起训练,分别在相机视角和BEV下预测目标物体,然后分别计算loss。来自perspective head的loss作为一项辅助loss引入了perspective supervision,帮助backbone的优化:


Ravamped Temporal Encoder

BEVFormer原先采用recurrent attention机制融合历史的BEV Feature,但简单增加recurrent步数并没有带来明显的提升,未能有效利用long-term的时间信息。
研究团队改进后的temporal encoder使用变形和拼接策略是:根据变换矩阵,将其他帧的BEV Feature变形对齐到当前帧,随后将所有帧的Feature在channel维度拼接起来,再使用一个residual network压缩维度,融合到当前的BEV Feature中。在这一encoder结构下,可以通过增加输入序列的时间间隔以利用long-term的时间信息;同时在offline setting下,还能进一步利用未来帧的信息。

Hybird Object Query和二阶段流程

BEVFormer v2的Perspective Head和BEV Head能分别在两个视角下作出物体的预测。相比只选取BEV Head的预测或是使用后处理进行结果的融合,团队提出了Hybird Object Query,将Perspective Head的proposal融合到BEV Head的query中,形成一个二阶段检测器,实现更好的结合。

图5:利用hybrid object query搭建的two-stage检测流程

如上图所示,BEVFormer v2的BEV head采用一个DETR decoder,它使用一组object query询问特征并给出proposal,其中reference point是BEV特征采样的参考点,表示物体可能出现的位置。原本的query完全来自于一组learnable embedding,因此存在着学习时间长、难以覆盖所有样本分布的缺点。而hybird object query在保留原有learnable query的基础上,在reference point中加入第一阶段预测的包围盒的中心位置,能够直接指示每个样本中可能存在物体的位置,解决了上述问题。

利用hybrid object query,perspective head和BEV head组合为以下的二阶段检测流程:

1. 第一阶段的perspective head在相机视角下预测物体

2. 将多个视角下的物体预测集合在一起并进行NMS后处理

3. 取NMS后包围盒的中心在BEV平面的投影点作为reference point

4. 与第二阶段DETR head的learnable query结合成为hybrid object query

5. BEV head使用hybrid object query进行第二阶段预测


实验结果超越传统SOTA方法


nuScenes 3D物体检测benchmark

表1:nuScenes test set的3D物体检测结果

BEVFormer v2在自动驾驶权威数据集nuScenes的3D物体检测任务上超越了已有SOTA方法,NDS为63.4,mAP为55.6,比之前最好的方法分别提升了 2.4和3.1。此外,使用InternImage-B作为backbone的模型也超过了之前的方法,InternImage-B和V2-99参数量相近但没有使用3D预训练,这证明了3D预训练不是必须的。


不同视角监督信号的比较

表2:不同视角监督信号的组合的对比

• Perspective Only:只使用perspective head

• BEV Only:只使用BEV head

• Perspective & BEV(BEVFormer v2):使用perspective head和BEV head组成二阶段检测器

• BEV & BEV:使用两个BEV head组成二阶段检测器
Perspective Only和BEV Only对比: BEV head使用多个相机视角的信息确定物体位置,因此具有更高的mAP。但是perspective head有更低的mATE和mAOE,表明它对深度和方向这些3D属性的预测更为准确。
BEV Only和Perspective & BEV对比: BEVFormer v2引入perspective supervision取得了NDS 2.5,mAP 1.9的较大提升,且mATE,mAOE和mAVE显著降低,模型能更好地感知3D场景,获取深度、方向和速度这些属性。

BEV & BEV和Perspective & BEV对比: 对two-stage pipeline进行消融实验,表明two-stage本身并不能提升性能,性能提升完全来自于perspective supervision的引入。


Perspective Supervision的泛化性

表3:使用不同图像backbone对perspective supervision进行消融实验

Perspective supervision可以泛化到多种不同结构和尺寸的2D图像backbone,均能带来NDS约3.0,mAP约2.5的显著提升。


其他实验表现

表4:不同训练时长的对比。Perspective supervision能促进模型的优化,加速收敛

表5:Perspective head和BEV head的不同选择对比。在perspective head的选择中,相比DETR3D head的稀疏预测,DD3D head的密集预测能提供更丰富的监督信号,因此效果更好

表6:BEVFormer v2使用的其他技巧的消融实验,包括图像级别的数据增强、输入序列的时间间隔增加、以及使用双向的时序信息。


新型图像主干网络可提升BEV感知能力

本文选择之前BEV感知方法中较少关注的图像backbone部分作为研究对象,旨在通过更强的2D图像backbone提供更好的图像feature来提升BEV模型的性能。本文提出的BEVFormer v2利用perspective supervision将新型2D图像backbone适配到BEV感知模型,相较已有方法取得了显著的提升。这意味着更强大的backbone具有进一步提升BEV感知模型性能的潜力,为后续探索和设计BEV感知领域的图像backbone提供了一个研究方向。


BEVFormer v2:让新型图像主干网络在BEV感知中发挥强大能力|论文解读脉脉
阅读 31
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...