雪咤
07-03·全栈工程师·5年+
LoopWM世界模型长时序稳吗?
1B小模型干翻百倍大模型
昨天刷到LoopWM论文直接给我看傻了,中国初创FaceMind做的,1B参数量的小模型,在世界建模任务上干翻了规模大它100倍的顶尖API,这不是夸张是真的打榜打出来的,现在已经登顶Hugging Face趋势榜第一了,Nvidia官方都在点赞。说真的这两年大家都在卷参数,你出个千亿我出个万亿,好像参数不大就不好意思说自己做AI,结果FaceMind直接告诉大家,不堆参数也能赢。他们核心思路特别巧妙,不是堆Transformer层数,而是让同一个参数共享的Transformer块在潜空间里循环迭代,反复打磨环境状态,简单场景少循环几次,复杂场景多循环几次,自适应计算深度,参数量直接干到原来的1/100。周鸿祎和陆奇的基金都投了,说明不是学术玩具是真有商业价值。我看完第一反应是,我们组之前花了半年训的7B世界模型,是不是方向就错了?老板昨天已经让我们调研复现了,说下季度必须上循环架构。说实话这才是AI该有的样子,不是靠算力堆料,是靠架构创新。有没有同样在做世界模型的脉友,你们怎么看这个Loop架构?真的有这么神还是paper里效果好?
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中