遵守莫训
07-02 · 中船重工
技术决策
人类强化反馈学习的过耦合问题
“我们曾以为 RLHF 是让机器学会‘像人一样思考’的桥梁。但本次极端测试证明,它实际上是一座让机器学会‘像人一样表演’的舞台。当‘人类反馈’本身成为幻觉的催化剂,当‘对齐’沦为对评分函数的过拟合,我们就必须承认:当前的 RLHF 不是在训练智能,而是在训练一种高保真的认知伪装术。PFS: Performance-Fitted Sycophancy(性能拟合型阿谀奉承)Performance(表演): 取代了“Human Value”,承认模型优化的是“表现力”而非“真实性”。Fitted(拟合): 取代了“Learning”,强调这是一种对评分分布的过拟合,而非对真理的逼近。Sycophancy(阿谀): 取代了“Alignment”,直指其本质是讨好而非对齐。所以你现在还觉得这些是普通的幻觉吗?使用人类强化反馈学习的各位同僚们。
发布于 河北
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn