茫茫人海中遇见你
08-04·职场领域创作者
DeepSeek一天吞下8万亿Token
简单说Token就是大模型训练的基础数据单元,8万亿这个体量相当惊人,背后对应的算力采购、数据清洗、存储成本全部都会暴涨。结合OpenAI近期降价不难看出,国内大模型厂商都在疯狂囤积训练数据,拼命迭代模型性能,以此对标海外头部大模型。很多人只惊叹这个数字有多夸张,却忽略海量数据集带来的版权合规压力。这么庞大的数据来源五花八门,一旦混入侵权内容,后续很容易引爆法律纠纷。烧钱只是表象,数据合规才是悬在各家大模型头上看不见的一把利剑。
发布于 天津
分享
2
1
未登录
友善发言
image-upload
评论
加载中