淼一小李
06-29 · 淼一科技
AI公司销毁文件数百万书籍训练模型引争议
AI 大模型训练高度依赖书籍这类高质量结构化文本数据,但版权问题一直是行业核心痛点。近期美国 AI 公司 Anthropic 的 “巴拿马项目” 随版权诉讼文件曝光,该公司通过第三方购入数百万本覆盖多品类的实体书籍,经准确率超 99.5% 的 OCR 技术扫描提取文本用于 Claude 大模型训练后,不仅销毁全部实体书载体,还对存储原始扫描副本的设备执行专业硬盘数据文件销毁,试图以 “去痕迹化” 方式规避版权风险,这一操作引发广泛争议。巴拿马项目的核心流程形成了 “采购 — 数字化提取 — 载体数据销毁” 的完整链路:通过第三方供应商从书店、批发商处购入数百万本实体书,覆盖小说、学术著作、专业教材等多个类别;之后用光学字符识别(OCR)技术进行高精度扫描 —— 准确率超过 99.5%,提取的结构化文本全部用于 Claude 模型训练;数字化工作完成后,所有采购的实体书籍便被统一进行数据销毁,全程未留存原始实体副本。这些细节是 2024 年上半年通过版权诉讼的法庭文件曝光的,文件显示该项目至少从 2022 年启动,一直持续到 2023 年底,主要在美国境内开展,扫描工作由合作技术服务商负责,书籍采购则覆盖了多个州的渠道。Anthropic 称公开网络数据质量参差、版权风险高,书籍内容更具权威性,而直接获取版权授权成本高、流程复杂,因此选择 “先复制、后销毁” 的方案。但法律层面,版权保护核心是作品复制权与传播权,即便销毁载体,未经授权制作数字化副本仍涉嫌侵权。据麦肯锡 2024 年报告,超六成 AI 企业数据来源不透明,近三成存在版权隐患。对比之下,OpenAI 已与多家头部出版社达成版权合作,Google DeepMind 发布白皮书披露数据授权情况,合规性更强。行业监管也在收紧,2024 年 5 月生效的欧盟 AI 法案要求 AI 开发者披露训练数据版权状态,违规最高处全球营业额 4% 罚款;Meta 则推出开放数据联盟,搭建合法训练数据共享平台,探索行业治本方案。Anthropic 的激进操作,未来将面临更高的法律诉讼风险。
发布于 河北
分享
评论
未登录
友善发言
image-upload
评论
加载中