满眼星河12138
08-07·快手员工
曝字节拟训练超5万亿参数大模型
曝字节拟训练超5万亿参数大模型
字节要训练超5万亿参数模型了。2.4万亿的Qwen 3.8-Max和2.8万亿的K3在它面前都是弟弟。张一鸣刚说不蒸馏,转头就搞了个国内已知规模最大的计划。但我想说的是,梁汝波在All hands上刚承认大语言模型被海外领先模型拉大了差距。差距怎么追,靠堆参数吗。5万亿参数的训练成本是多少,算力从哪来,训练数据够不够。这些问题还没答案,计划就已经放出风来了。Seed Foundation负责人项亮主导,预训练数据负责人沈科合作。这配置说明字节是认真的。但认真归认真,5万亿参数的模型训出来之后能不能用、好不好用,是另一回事。规模越大,推理成本越高,普通开发者根本用不起。不蒸馏是对的,但“不蒸馏”和“堆参数”之间没有必然联系。字节选了最难的路,希望别走到一半发现走不下去。
发布于 中国香港
分享
评论
未登录
友善发言
image-upload
评论
加载中