谢剑浩
08-11 · 墨客文创(绍兴)有限公司
《钱江十日谈》02
第2日 世界模型:智能如何理解现实?我们换了一个话题。我说:“聊聊世界模型吧,李飞飞那个。”在J博士当时的解释里,世界模型想让智能不只描述一个场景,还能推演场景接下来可能怎样变化。它关注物理规律、空间关系和因果联系,目标从语言中的关联继续走向对现实变化的预测。我做了区分:大语言模型更多是在总结文本经验,世界模型则更像是在总结物理世界的规则。我认为,它可能是通向通用人工智能的一块垫脚石。J博士说,这个区分接近问题的一部分,但不能只看输入。语言模型擅长语言中的规律,世界模型关注现实世界的规律;未来还可能需要视觉、感知和与环境的互动。两种能力更可能相互补充,而不是彼此取代。谈到通用智能还缺什么时,J博士列出了几个需要共同推进的方向:对世界的预测、长期记忆与持续学习,以及自主规划和行动。单独拥有其中一项,并不足以自动抵达通用智能。我更在意长期记忆。我问,智能对世界的理解最后是否仍要转成文本,能不能以别的方式存在;我又把问题转向人脑,追问人的知识和经验究竟以什么方式保存。J博士说,模型内部的信息表示并不等同于一份份文本文件,可以用高维数字表示来理解;人的记忆也不是静态文件,更像分布在神经系统中的动态重建。至于人的记忆机制,当时的神经科学仍有许多未解之处,因此两者只能有限类比,不能直接等同。我判断,如果长期记忆这一关被解决,通用人工智能的实现也许会明显加快。J博士保留了一点。他说,长期记忆如果取得突破,确实可能成为能力的放大器,但记忆、推理、世界模型、持续学习、规划和环境反馈仍要彼此配合;哪条路最终成立,当时并没有共识。我又换了一个角度:在我看来,大语言模型和世界模型首先接收的是不同类型的信息。前者主要面对语言文本,后者更多面对物理规则和三维空间。J博士补充说,差别也在学习目标。语言模型更偏向预测接下来最合理的内容,世界模型则试图预测世界发生变化以后会怎样。一个擅长理解与表达,一个着重模拟与预测,未来可能还要与记忆和规划共同工作。我因此更看重世界模型进入具身智能和现实生产场景的可能性,希望它最终能在客观世界中创造实际价值。J博士仍然没有把两条路线写成二选一。他认为,真实环境中的行动需要理解物理约束,而交流、表达、记忆和规划也不能缺席。谈到这里,问题已经从“会不会说”推进到了“能不能理解环境并据此行动。
发布于 浙江
分享
评论
未登录
友善发言
image-upload
评论
加载中