AI招聘外包出海唐格
07-02 · AA投资
端到端VLA(视觉-语言-动作)模型被视为通往通用机器人智能的关键路径。但当机器人从单臂Franka换成双臂ALOHA,再从ALOHA换成人形GR-1,绝大多数模型的表现就像断崖般下跌。原因很简单——不同机器人的关节数、运动学配置、控制接口完全不同。模型学的6自由度抓取,碰到7自由度平台直接就"晕"了。但你有没有想过一个问题:机器人操作背后的"思考过程"真的是千差万别的吗?无论机械臂是6个关节还是7个关节,从桌子上拿起杯子的认知逻辑几乎一样——感知场景→识别杯子→规划路径→执行抓取。既然"想"法相同,为什么模型学到的表征偏偏无法跨本体(embodiment)迁移?RUCKBReasoning团队最新提出的ZR-0给出了一个深具颠覆性的答案:他们用密集的具身思维链(ECoT)监督,在60M帧数据上强制VLM学习"与本体无关的推理",再让动作专家专注解决"本体特有的控制"。最终结果显示,模型在三个仿真基准和真实机器人上全部刷出SOTA,而在推理时——完全跳过思维链生成,推理成本为零增加。开源代码和26亿参数预训练权重已放出:https://taou.cn/a/iD2DLD]核心痛点:为什么跨本体迁移至今是难题?当我们训练一个VLA模型时,数据通常来自多种机器人平台。不同平台的状态向量维度和动作空间维度各异——有的是关节位置控制,有的是末端执行器位姿控制,旋转表示也可能是欧拉角或四元数。目前工业界的标准做法是"零填充+按本体归一化"——把状态和动作统一填充到固定维度(比如64维),对多余维度做Mask处理。这种做法让联合训练成为可能,但它本质上是在格式层面打补丁,完全没有触及语义层面的对齐问题。打个比方。假设关节1在Franka上是肩部俯仰关节,在ALOHA上是左臂肘部关节——两个维度虽然都在同一位置,物理含义却完全不同。模型如果只靠动作监督信号去学习,很容易学到"填充维度位置的模式"而非"可迁移的语义理解"。这就解释了为什么很多VLA模型在已知平台上表现还可以,一旦换一个新平台就立刻水土不服。它们学的不是"如何操作物体",而是"如何在特定机器人上执行特定动作"。你在做跨本体迁移实验时,是否也遇到过类似困境?欢迎在评论区分享踩坑经历~原理拆解:如何让机
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中