大厂职场观察者
07-02·测试·5年+
LoopWM世界模型长时序稳吗?
1%的数据打出百亿模型的效果,你信吗?行业主流做法是堆层数——模型越深、参数越多、效果越好。但深了以后梯度传不下去,长任务做着做着就“失忆”了。LoopWM走了一条完全不同的路:不堆层,只循环。同一个Transformer块反复用,梯度传播路径短,不存在多层连乘带来的衰减问题。结果就是——1B参数的模型,效果对标100B的闭源大模型。参数效率提升100倍,训练数据只要传统的1/50。这不是优化,是换了个玩法。长时序稳不稳?从根源上把梯度消失的问题解决了。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中