Steven张宏伟
07-07 · 险峰长青
7月7日,蚂蚁灵波于发布新一代空间感知模型LingBot-Depth 2.0,并同步开源视觉基座模型LingBot-Vision。两款模型面向机器人视觉在空间感知、精细识别和复杂环境适应中的应用需求,旨在提升机器人在真实物理世界中的三维感知能力。LingBot-Depth是面向真实场景的深度补全模型,可理解为机器人获取物理空间信息的视觉能力之一。此前1.0版本主要针对透明、反光、密集物体等场景下的深度感知问题。此次发布的2.0版本在训练数据、模型精度和复杂场景适应性方面进行了升级。据蚂蚁灵波,LingBot-Depth 2.0的训练数据规模从1.0版本的300万扩充至1.5亿。在深度补全基准的16项测评中,该模型取得12项第一。在室内大面积深度缺失场景中,深度误差较上一代明显下降,RMSE从0.132降至0.062。对于玻璃、镜面、透明物体等传统深度相机容易出现失效或数据缺失的场景,LingBot-Depth2.0可补全较完整、平整的三维结构。除数据规模扩大外,LingBot-Depth 2.0的能力提升也来自同步开源的LingBot-Vision。作为通用视觉基础模型,LingBot-Vision采用面向空间感知的几何建模思路,将“边界结构”作为预训练目标。蚂蚁灵波称,该模型具备亚像素级边界定位和空间结构理解能力,可为深度补全等任务提供视觉表征支持。在预训练数据方面,LingBot-Vision使用1.6亿张图像,规模较部分主流视觉基础模型更小。蚂蚁灵波表示,与主流视觉基础模型相比,LingBot-Vision在物体边界和空间结构识别方面更稳定,并可在视频中连续追踪物体边界。此次开源的LingBot-Vision包括ViT-G、ViT-L、ViT-B、ViT-S四个版本。除支持LingBot-Depth 2.0训练外,该模型也具备面向多类视觉任务的通用能力。蚂蚁灵波是蚂蚁集团旗下具身智能公司,成立于2024年12月,致力于打造机器人通用大脑。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中