小橙子在羊角村长跑
08-07·后端开发·1年以下
AI圈最近最大的震动,来自张一鸣在字节Seed全员会上的罕见定调。一句话总结:字节禁止依靠外部模型蒸馏走捷径,同时筹备训练超5万亿参数超大基座模型。先通俗讲明白,什么是模型蒸馏。简单理解:拿成熟头部大模型的回答、推理数据当作素材,快速训练自家模型。优点一目了然:省钱、速度快、评测榜单分数快速拉升,是当下很多团队追赶进度的捷径。那为什么张一鸣坚决叫停这条路?第一,蒸馏本质是模仿别人的答案。依靠外部模型训练,短期可以拉高跑分,但是模型很难形成原生的底层推理能力,长期只会永远跟跑,难以实现超越。第二,长期依赖捷径,会消磨团队从零搭建基座大模型的基本功。一旦形成路径依赖,基础训练能力持续弱化。第三,隐藏合规风险。绝大多数头部AI服务商用户协议,明确禁止调用接口数据训练竞品模型。所以字节选择一条更艰难的路线:放弃短期快速超车的手段,押注原生预训练。网传正在规划超5万亿参数大模型。对比参考,当前Kimi K3约2.8万亿、通义Qwen Max约2.4万亿。一旦落地,规模直接翻倍。很多人争论:这究竟是一场豪赌,还是通向通用人工智能AGI的必经之路?两种视角客观看待:看好者认为:只有完整自主的原生基座,才有机会探索智能上限;依靠模仿永远摸不到技术边界。质疑观点:超大模型训练算力、数据、资金成本极其恐怖,参数规模不等于智能能力,很有可能投入巨大,收益不及预期。值得划一个关键误区:字节不是全盘否定蒸馏技术。内部允许自研模型之间蒸馏优化轻量化版本,红线只有一条:禁止蒸馏竞争对手外部大模型。这场抉择,本质是短期榜单成绩,和长期原生技术壁垒之间的取舍。接下来整个大模型行业,都会盯着字节这场超大模型实验,看看“大力出奇迹”能不能跑通。#张一鸣 #字节跳动 #大模型 #DeepSeek #AI前沿
发布于 河南
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn