七夜zippoe
06-28·AI领域创作者
康奈尔TLM零成本改层有用吗?
康奈尔+Mila 那篇 TLM(Tapered Language Models,arXiv:2606.23670)最近在架构圈刷得欢,标题"零成本改层"其实有点误导——它不是"改层参数",是"改层间容量分配",而且"零成本"指参数总量和 FLOPs 不变,不是"不改代码零代价上车"。先纠个误解:TLM 不是给现成模型做微调改层,是预训练阶段的架构重分配——把 MLP 宽度按余弦调度从前层往后渐缩(比如首层 1.5x 基线宽度、末层 0.5x,总量守恒),早期层多扛容量做句法/语义基底,后期层本来就是 refine residual stream,窄点不亏。Mila 在 440M/760M/1.3B 上跨 Transformer、Gated Attention、Hope-attention、Titans 四种架构都稳涨困惑度+下游,确实零额外成本。但"有用吗"得分人:预训练/基座团队:值得跟,尤其 1B 以下小模型,TLM 这种"免费杠杆"性价比高,实现也不复杂(MLP 宽度四舍五入到 16 倍数保硬件效率);应用层/微调党:跟你没关系——TLM 是训的时候改分配,你手上那个 7B/13B/70B 是均匀宽度的,切不成 TLM,除非厂商重训放出 TLM 版基座;调度别自己拍:1.5x→0.5x 余弦是 Mila 扫出来的,线性/sigmoid 都试过,余弦最优,自己乱改比例容易反效果。打工人启示:TLM 这波信号是"架构默认项(均匀叠层)被Challenge"的开始,继 MoD、MoE 之后又一条线。但跟 LoRA / Prefix / ProxyAttn 那类"推理/微调侧改法"不是一类,别混着看——训模型的可以摸,做应用的等火山/智谱/阶跃哪家居然出 TLM 版基座再切,现在凑热闹没你份。你们组预训练那边有试 TLM 分配吗?还是继续蹲厂商出成品?评论区见。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中