何心怡
08-06 · 一合人力集团
最近跟几个做机器人learning的朋友聊,大家争论最多的问题就是——具身智能的预训练数据到底从哪来?一种思路是拼命采遥操数据,一种思路是用仿真合成数据。但前两天看WAIC上亮源新创姜旭的分享,他提出了一个不太一样的判断:具身智能真正的预训练数据来源,应该是互联网规模的人类行为视频。逻辑其实很顺——就像GPT在海量文本上预训练一样,具身模型也需要从大规模物理世界数据中学习运动先验、空间理解和交互规律。互联网已经有约100亿小时的视频内容,这些视频主要来自日常生活,恰好对应了具身智能最可能率先落地的场景。当然这个判断跟行业主流不太一样,有朋友觉得视频数据缺action标签没法直接用来训练。但姜旭是RLHF的发明人之一,亲身经历过GPT从无人看好到引爆全球的过程——他相信具身智能会沿着大模型走过的路径再走一遍。有没有大佬分享看法?视频数据能否成为具身预训练的主力?
发布于 湖北
分享
2
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn