茫茫人海中遇见你
08-04·职场领域创作者
DeepSeek一天吞下8万亿Token
看到8万亿Token这个数字,第一反应确实很震撼,支撑这种规模训练,烧的钱绝对是天文数字。承认大模型想要变强,离不开足量高质量训练数据,但单纯堆Token数量不等于模型实际效果就一定变好。如果数据集混杂大量低质量、重复甚至侵权内容,哪怕数据量再庞大,对模型提升也十分有限。真心希望国内大模型公司别陷入单纯比拼数据规模的内卷。不能只追求跑分好看,也要把数据版权合规放在重要位置。不要等被起诉维权之后才临时补救。行业从业者也应该理性看待网传训练数据,很多流传出来的数据只是坊间传闻,不一定代表官方真实情况,吃瓜同时多一份辨别力。
发布于 天津
分享
4
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn