石灿
08-09 · 北京嗅态信息科技有限公司
字节对模型蒸馏的限制,比外界想象得更彻底。限制覆盖了整个外部模型生态。美国前沿闭源模型不能用于蒸馏,开源模型同样被纳入禁区。为了把规则真正落到研发环节,字节内部还通过API调用检测等方式加强管理,减少研发团队借助外部模型输出提升能力的空间。表面上看,张一鸣反对蒸馏是对一种技术路径的取舍,放到Seed的发展阶段来看,背后其实是对大模型研发路线的一次选择。张一鸣的判断很明确。训练大模型是一项高难度、长周期的工程,模型能力最终需要建立在预训练、数据、算法和工程体系的长期积累上。即使Seed的产出当前与全球前沿水平仍有差距,字节也愿意承受阶段性的落后,把自主训练这条路完整走一遍。这场关于蒸馏的讨论,也由此超出了技术方法本身。中国大模型逐渐逼近全球前沿之后,一个更重要的问题摆到了行业面前:当追赶进入更深水区,大模型公司真正比拼的究竟是什么?理解这场分歧,需要先回到模型蒸馏在大模型产业中的具体位置。模型蒸馏本身是一项成熟的技术。简单来说,就是用能力更强的“教师模型”去引导规模较小的“学生模型”,在大幅降低参数与推理成本的同时,提升模型的部署效率。如今,这已是行业优化模型性能的通用手段。行业的争议焦点,其实集中在另一类行为上——利用竞争对手的闭源模型接口,通过大规模调用获取输出数据,再拿这些数据去训练自己的基础模型。这种做法在业内通常被称为模型“黑盒蒸馏”。这种模式的吸引力显而易见。对资源有限的团队来说,直接调用领先模型生成高质量样本,能省去海量的数据构建成本,让新模型在代码、数学和逻辑推理等硬指标上实现“弯道超车”。此前,不少开源社区也是借由这种“教师模型”输出的迁移,快速把小模型的性能提升了上去。但是,蒸馏天然存在“教师模型天花板”,基础模型的竞争,终究不单是榜单分数的比拼,更是数据体系、架构演进、预训练、强化学习及工程能力的综合沉淀。若训练数据大量源自对手模型,最终也只能学到对方的能力边界,难以摸到真正的动力内核。对于立志冲进全球第一梯队的大模型公司来说,长期依赖外部模型的输出,无异于将自身的上限交给了对手。更深层的问题在于,研发组织的长期演化。
发布于 贵州
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn