Brant
07-10 · 科锐福克斯
视频算法
做视频生成,可能比想象中更接近具身智能
上个月参加了宇树在浙大举办了实习生和2027校招创始人专场。比起机器人又完成了什么高难度动作,我更好奇的是:当具身智能公司开始大规模走进高校,它们现在最缺的究竟是什么样的人?过去我们看机器人,首先看的是“身体”。能不能跑、能不能跳、能不能保持平衡、能不能完成更复杂的动作。但随着本体能力逐渐成熟,真正难的问题正在变成:机器人来到一个从未见过的房间后,能不能理解一句模糊的指令,判断接下来会发生什么,并连续完成任务。王兴兴最近几次公开分享中,都把机器人的关键瓶颈指向了模型。他还特别提到一种值得关注的路线:让模型先在“想象”中生成机器人完成任务的未来视频,再将视频中的变化与真实动作对齐。这让我开始重新理解视频生成。表面上,它是在生成一段好看的内容;但更底层的问题是,模型能不能理解空间、时间、物体关系和状态变化,能不能预测“接下来会发生什么”。当然,生成一段机器人收拾房间的视频,不等于真的能够控制机器人。真正的分水岭,是能不能把视觉预测、物理变化与可执行动作放进同一个模型里。也是因为这个原因,我觉得把生数科技只看成一家AI视频公司,可能已经有点过时了。外界更熟悉的是Vidu,但生数现在公开表达的技术路线已经是通用世界模型:一边通过Vidu探索数字世界的生成,另一边通过Motus、MotuBrain探索物理世界中的行动,把视频和动作放进统一模型中学习。它不完全是“视频公司突然开始做机器人”。更像是同一套多模态生成能力,正在同时向两个方向延伸:一个方向生成数字世界,另一个方向理解并作用于物理世界。从职业选择的角度看,这意味着一些原本被分开的方向可能正在汇合:视频生成、多模态、世界模型、VLA、强化学习、机器人学习,以及大模型训练和推理基础设施。做内容生成的人,未必离具身智能很远;做机器人模型的人,也未必只能去本体厂。
发布于 浙江
1
1
1
未登录
友善发言
image-upload
评论
加载中