钱友权
07-20 · 遵义软件园爱豆云科技有限责任公司
资料管理
全国高质量数据集达12万个
7月中旬,2026世界人工智能大会语料论坛在上海举行。国家数据局局长刘烈宏在论坛上公布了一组关键数据:截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB,较一季度末增长超60%。这一体量相当于中国国家图书馆数字资源总量的547倍左右。七个数据标注先行先试城市标注规模超119PB,服务425个大模型研发,带动相关产业产值263亿元。刘烈宏表示,当前人工智能发展正从“卷算法、卷算力”转向“卷数据”。下一步,国家数据局将深入实施强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大行动,进一步构建服务人工智能的高质量数据供给体系。论坛上提出的“数据在闭环”理念成为讨论焦点——数据标注不再只是静态的“加工环节”,而是嵌入模型训练、推理、反馈的全流程闭环。语料运营公共服务平台2.0在论坛期间正式发布。刘烈宏特别强调,要以模型应用牵引数据供给、以数据驱动模型迭代,推动实现数据集有偿使用的价值闭环。从3月底的11.6万个到6月底的12万个,全国高质量数据集在三个月内净增约4000个,总体量增长超60%。数据集规模的快速扩张,对数据标注的质量、效率和标准化提出了更高要求。与此同时,七个先行先试城市标注规模达119PB,服务425个大模型研发,数据标注在人工智能产业链中的基础性支撑作用日益凸显。
发布于 贵州
分享
评论
1
未登录
友善发言
image-upload
评论
加载中