张某峰
08-04·深圳市尚数网科技有限公司员工
给AI喂数据前,先过安检
你给AI喂了一堆数据,它学得贼快,但你有没有想过——那些数据里藏着的手机号、病历、银行卡号,AI也一并消化了?等用户找上门说"你怎么知道我上周看了痔疮科",你就懂了:AI学太多也犯法。五条合法路,条条是窄门法律给了AI用个人信息的五条路:同意、合同必需、法定职责、法定义务、匿名化。听起来选择不少?前四条基本是"看得到吃不着"。用户同意?几亿条数据逐条点确认,等你签完AI都过气了。法定职责?那是给公安机关和税务机关准备的,你的商业模型凑什么热闹。合同必需?得证明没这数据模型就训不出来,比证明你没外卖就活不了还难。真正能敞开用的路只有一条:匿名化。处理后的数据无法识别任何人、不可复原,法律上就不再算个人信息,爱怎么训怎么训。匿名化:法律说行,技术说难听着美好,但法定匿名化的门槛高到离谱——既不能识别特定人,也不能通过任何方式还原。现实呢?大部分企业做的只是"去标识化":删掉姓名、身份证号就以为万事大吉。但哈希加密、字段替换在AI的关联分析面前跟透明差不多。海量数据一汇总,AI分分钟把你拼回来。网信办早就发话了:加密、脱敏后的信息依旧受《个人信息保护法》管。你以为脱了马甲就不认识你了?法律说:认识,接着管。四道技术防线:给AI装上隐私过滤器既然匿名化暂时够不着,那就把能做的做到位。第一道:源头拦截——数据进训练池前先过安检。人名电话、人脸证件、声纹,全部提前筛掉。国标还要求违法信息超5%直接整批弃用。烂数据训出来的模型也是烂模型。第二道:分级脱敏——不是所有数据一刀切。手机号可以遮掉,但医疗数据得保留疾病特征才有训练价值。按模态分层处理,该遮的遮,该泛化的泛化,映射表和训练数据严格隔离存放。第三道:往匿名化够——两份国标征求意见稿已经指了路:先判断可行性,再选技术实施,最后用模拟攻击测试验证效果。达不到"不可识别不可复原"的硬标准,就别说自己做了匿名化。第四道:常态化管控——脱敏不是一次性手术,是长期养生。参考工信部YD/T4245标准,选对算法、留存日志、定期复测,保证整个流程可追溯、可审计。一句话总结AI训练数据的个人信息合规,没有银弹。法律依据打地基,技术防护砌墙体,流程管控盖屋顶——三层缺一不可。别想着只装个过滤器就万事大吉,那相当于只给门上了锁但窗户全开着。合规是个系统工程,偷工减料迟早翻车。
发布于 广东
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn