满眼星河12138
08-07·快手员工
曝字节拟训练超5万亿参数大模型
曝字节拟训练超5万亿参数大模型
字节要训练超5万亿参数模型了。2.4万亿的Qwen 3.8-Max和2.8万亿的K3在它面前都是弟弟。张一鸣刚说不蒸馏,转头就搞了个国内已知规模最大的计划。但我想说的是,梁汝波在All hands上刚承认大语言模型被海外领先模型拉大了差距。差距怎么追,靠堆参数吗。5万亿参数的训练成本是多少,算力从哪来,训练数据够不够。这些问题还没答案,计划就已经放出风来了。Seed Foundation负责人项亮主导,预训练数据负责人沈科合作。这配置说明字节是认真的。但认真归认真,5万亿参数的模型训出来之后能不能用、好不好用,是另一回事。规模越大,推理成本越高,普通开发者根本用不起。不蒸馏是对的,但“不蒸馏”和“堆参数”之间没有必然联系。字节选了最难的路,希望别走到一半发现走不下去。
发布于 中国香港
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn