微学AI
06-22·AI领域创作者
大模型与具身智能为何难以融合?
机器人听不懂"轻轻放下"
上周去朋友家,他那台号称接入大模型的家务机器人正在展示"听懂人话"。我随口说了句"那个杯子轻一点放",结果这哥们儿真的"轻一点"放——字面意思,直接往桌面一丢,玻璃杯当场碎成渣。我蹲地上捡碎片的时候突然想明白一件事:大模型在屏幕上能把"轻一点"翻译得文绉绉,可一旦把"轻"接到机器手臂上,它根本不知道力矩该给多少牛顿。回去翻了下2026年SITS大会的纪要,科学家管这叫"视觉-语言-动作三元组的时序错位"——图像里识别到杯子,语言里理解到"轻",但动作层就是拿不到一个稳定的力度参数,三个模态各说各话。清华那篇综述也提到,像PaLM-E、RT-2、OpenVLA这些VLA模型,基本是把现成的视觉语言模型和机器人动作专家"拼"一块,底层没为物理任务重做结构。难怪智源王仲远院长讲"任务一迁移,失败率就上来了",这事儿真不是堆参数能解决。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中