大厂职场观察者
06-26·测试·5年+
康奈尔TLM零成本改层有用吗?
简单说就是把模型每一层的“算力”重新分一下。以前做模型,每层给一样的参数,2017年Transformer出来就这么干,没人质疑过。康奈尔和Mila的研究发现,前面几层干的是语法、词汇的粗活,后面几层基本就是在确认前面算好的东西,没啥新贡献。那不如把后面层的资源挪到前面去?他们试了,参数总量不变、算力成本不变,只是把MLP宽度从前往后做个余弦渐缩。结果4.4亿参数模型上,困惑度从16.28降到了14.44。四个主流架构、三种规模都有效。零成本白捡的性能提升,跟装修房子把储物间的电分给厨房一样——总量没变,但用得对了。
发布于 北京
分享
评论
2
未登录
友善发言
image-upload
评论
加载中