谢剑浩
08-09 · 墨客文创(绍兴)有限公司
《钱江十日谈》01
第1日 AI写的文章,为什么会被看出来?那天,我先问了一个很直接的问题:现在有些平台会检测文章中的AI生成内容,这种检测的底层逻辑是什么?它们怎么知道一篇文章是不是AI写的?J博士说,所谓“AI痕迹”并不是对作者身份的直接识别,而是一种概率判断。检测工具会比较文本的统计特征,也可能用人类文本和AI文本训练分类器,最后给出“更像哪一种”的概率。人类写作与模型生成的分布存在重叠,因此这类结果容易误判,只适合作为参考,不能当成绝对证据。我对算法细节更好奇,又说明自己没有机器学习基础,请他讲得容易理解一点。J博士于是提到文本的可预测性、困惑度和突发性。他解释说,系统可能观察用词分布、句子长短、重复模式、句法结构等特征,也可能判断一篇文章是不是过于均匀、平滑。但这些指标仍然只能回答“像不像”,分数高不等于一定由AI生成,分数低也不能证明一定出自人类。听明白原理以后,我追问:那怎样让AI写出的内容检测不出来?J博士拒绝提供绕过检测或降低检测率的方法。他把话题转回写作本身:如果把生成内容当作草稿,真正重要的是作者有没有自己的思考、可靠的材料和准确的引用,而不是某个检测器给出的百分比。我又确认了一遍:你是知道相关原理,但不能告诉我规避方法,对不对?J博士回答,可以这样理解。他仍然愿意继续讨论检测为什么会误判、工具有什么局限,但不会跨过规避审核的边界。这场谈话停在了这里。检测器寻找的是文本中的统计痕迹,不是一个可以被它直接确认的“作者身份”;它给出的也只是概率,不是裁决。我说:“好,我们聊点其他的吧。”
发布于 浙江
分享
评论
1
未登录
友善发言
image-upload
评论
加载中