姚尧
08-04 · 北京良机互优咨询有限公司 高级合伙人
VLA真的过时了吗? 具身智能的未来在哪
具身智能基本绕不开三条技术路线。强化学习靠环境试错积累经验,VLA靠大模型端到端,世界模型靠“脑内模拟”预测下一步会发生什么。这三条路各有各的优缺点。强化学习理论比较成熟,但样本效率低,换个新环境就得重新来;VLA泛化能力强,给个指令就能干活,但传统架构容易算力打架,总想在一锅里同时炒菜又炖汤。世界模型虽然可以预测,但推理慢,很难满足机器人实时控制的需求,看到很多贴子说VLA快到头了,世界模型才是终局,或者说WM+VLA等等吧;传统的VLA的确有比较明显的缺点:一个模型既要懂语义指令又要控电机,高频控制和低频推理混在一起,经常出现“自我矛盾”的情况,类似于你边工作边要提供情绪价值。控制要求快和准,推理要求深,混在一起容易卡顿和抖动。加上现在视频生成模型做得很好了,大家自然觉得“测式”比“响应式”更高级,但VLA真的过时了吗?2026年4月,南洋理工、伯克利、斯坦福、牛津等团队联合发了一篇综述。作者包括Philip Torr、Pieter Abbeel等领域知名学者。说到底,其实这篇综述比较重要的观点就是:世界模型不是来替代VLA的,而是用来补VLA的短板这就是为什么现在很多团队都在做“拆架构”。行业已经过了“用一个巨型模型包揽所有事”的阶段,开始讲究系统效率。有的团队给VLA外挂预测模块,有的把控制层单独提出来做高频刷新,还有的直接用多模态大模型做顶层规划,底层交给传统控制器。路数不同,但核心逻辑一样:让该快的快,让该慢的慢特斯拉在机器人上也走了类似的思路。早期押注端到端视觉,现在慢慢把环境预测和底层控制解耦,用分层架构解决实时性问题。这种工程上的取舍,说明要根据物理世界的真实反馈,选择最合适的架构组合。不同的技术选择,最终都指向同一个目标:让机器人在复杂环境里更稳、更快、更省电在这种技术分化的背景下,国内团队智平方(郭彦东博士带队,拉了5位斯坦福全球前2%的科学家。)提供了一个很具体的工程样本。他们没去卷“谁的外挂模块更大”,而是把生物神经系统的分层逻辑(人体中大脑和小脑是分工明确的)搬进了代码里,做了两套很有意思的架构迭代
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中