雪咤
07-03·全栈工程师·5年+
LoopWM世界模型长时序稳吗?
做具身智能最大的痛点就是世界模型不准,长任务根本做不了,LoopWM出来之后我们内部测了两周,说实话看到了真正能落地的希望。说点真实的:之前我们用的主流世界模型方案,在仿真环境里看着挺好,一到真实机器人上就拉胯,机器人手臂伸出去抓个杯子,前面5步预测还挺准,抓起来之后往回走的过程中模型就开始"幻觉"了,有时候杯子"消失"了,有时候位置飘了,机器人直接就把杯子甩出去了,这种状态怎么敢让它进家庭干活?换了LoopWM架构之后,我们做了一个端茶倒水的完整任务测试:从桌子上拿茶杯→走到饮水机→接水→盖盖子→送到人面前,整个过程大概2分钟,200多步,中间没有重置过世界模型,一次成功率从之前的20%提升到了70%,这在以前是不敢想的。当然问题也不少:透明物体还是预测不准,强光下稳定性下降,突然出现的陌生物体还是会懵,但至少大方向对了。LoopWM的Test-Time Scaling也是个亮点,简单任务少跑几轮推理快,复杂任务多跑几轮精度高,可以根据场景动态调整计算量,这对机器人端部署太重要了,毕竟机器人板子上的算力有限。另外昨天刚看到LeCun团队出了AdaJEPA,让世界模型能在交互中持续学习,跟LoopWM的架构如果能结合起来就更完美了。我大胆预测,今年年底到明年上半年,基于新一代世界模型的具身机器人会有一波真正的落地潮,不再是那种演示视频里的"表演",而是真的能在真实环境里干活。做机器人的朋友们,你们现在用的什么世界模型方案?效果怎么样?
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中