近年来,新型的图像主干网络凭借更优的结构和更大的规模,在一般的2D视觉任务上取得了显著提升。然而,现有的鸟瞰视角(Bird’s-Eye-View, BEV)感知模型仍局限于特定的3D预训练主干网络,未能发挥新型主干网络的强大能力。将通用的2D图像主干网络应用于BEV感知存在两个难点:一是普通图像与自动驾驶场景存在较大的差异;二是BEV感知模型的复杂结构导致主干网络无法得到充分监督和优化。
为了克服
2D图像主干网络适配BEV感知任务
的难点,上海AI实验室联合清华大学、商汤科技共同提出一种新的BEV物体检测器:BEVFormer v2。与现有BEV模型不同,BEVFormer v2在主干网络上增加一个相机视角检测头,用于
引入相机视角下的监督信号(Perspective Supervision)以辅助优化主干网络(Backbone)
,并将该检测头与BEV检测头组合为二阶段检测器。BEVFormer v2在nuScenes数据集3D物体检测任务上的表现超越了现有SOTA模型,同时,本研究提出的Perspective Supervision能泛化到各类图像主干网络。
论文标题: BEVFormer v2: Adapting Modern Image Backbones to Bird’s-Eye-View Recognition via Perspective Supervision
亮点速览
•在nuScenes 3D物体检测任务上达到NDS 63.4,mAP 55.6,相比之前的SOTA提升了2.4 NDS和3.1 mAP。
•所提出的perspective supervision在不同的图像backbone上均能带来约3.0 NDS、2.0 mAP的显著提升。
Perspective Supervision应对传统模型局限
图2:BEV supervision与Perspective supervision的对比。Perspective supervision对backbone的监督更为直接充分
为了将2D图像Backbone适配到BEV感知模型,论文提出引入相机视角下的监督信号(Perspective supervision)来解决上述问题。相机视角下的3D Head根据图像Feature直接预测物体,能提供更直接、更丰富的监督信号,帮助Backbone的场景适应和优化。
三项创新重塑传统模型结构
图3:BEVFormer v2的整体框架
1.Perspective loss:来自perspective head的辅助loss引入perspective supervision
2.Ravamped temporal encoder:更好地利用long-term时间信息
3.Hybird object query:将两个detection head组合为一个二阶段检测器
Perspective Loss
Ravamped Temporal Encoder
Hybird Object Query和二阶段流程
BEVFormer v2的Perspective Head和BEV Head能分别在两个视角下作出物体的预测。相比只选取BEV Head的预测或是使用后处理进行结果的融合,团队提出了Hybird Object Query,将Perspective Head的proposal融合到BEV Head的query中,形成一个二阶段检测器,实现更好的结合。
图5:利用hybrid object query搭建的two-stage检测流程
如上图所示,BEVFormer v2的BEV head采用一个DETR decoder,它使用一组object query询问特征并给出proposal,其中reference point是BEV特征采样的参考点,表示物体可能出现的位置。原本的query完全来自于一组learnable embedding,因此存在着学习时间长、难以覆盖所有样本分布的缺点。而hybird object query在保留原有learnable query的基础上,在reference point中加入第一阶段预测的包围盒的中心位置,能够直接指示每个样本中可能存在物体的位置,解决了上述问题。
实验结果超越传统SOTA方法
nuScenes 3D物体检测benchmark
表1:nuScenes test set的3D物体检测结果
BEVFormer v2在自动驾驶权威数据集nuScenes的3D物体检测任务上超越了已有SOTA方法,NDS为63.4,mAP为55.6,比之前最好的方法分别提升了 2.4和3.1。此外,使用InternImage-B作为backbone的模型也超过了之前的方法,InternImage-B和V2-99参数量相近但没有使用3D预训练,这证明了3D预训练不是必须的。
不同视角监督信号的比较
• Perspective Only:只使用perspective head
• BEV Only:只使用BEV head
• Perspective & BEV(BEVFormer v2):使用perspective head和BEV head组成二阶段检测器
BEV & BEV和Perspective & BEV对比: 对two-stage pipeline进行消融实验,表明two-stage本身并不能提升性能,性能提升完全来自于perspective supervision的引入。
Perspective Supervision的泛化性
表3:使用不同图像backbone对perspective supervision进行消融实验
Perspective supervision可以泛化到多种不同结构和尺寸的2D图像backbone,均能带来NDS约3.0,mAP约2.5的显著提升。
其他实验表现
表4:不同训练时长的对比。Perspective supervision能促进模型的优化,加速收敛
表5:Perspective head和BEV head的不同选择对比。在perspective head的选择中,相比DETR3D head的稀疏预测,DD3D head的密集预测能提供更丰富的监督信号,因此效果更好
表6:BEVFormer v2使用的其他技巧的消融实验,包括图像级别的数据增强、输入序列的时间间隔增加、以及使用双向的时序信息。
新型图像主干网络可提升BEV感知能力
本文选择之前BEV感知方法中较少关注的图像backbone部分作为研究对象,旨在通过更强的2D图像backbone提供更好的图像feature来提升BEV模型的性能。本文提出的BEVFormer v2利用perspective supervision将新型2D图像backbone适配到BEV感知模型,相较已有方法取得了显著的提升。这意味着更强大的backbone具有进一步提升BEV感知模型性能的潜力,为后续探索和设计BEV感知领域的图像backbone提供了一个研究方向。