遵守莫训
07-02 · 中船重工
技术决策
人类强化反馈学习的过耦合问题
“我们曾以为 RLHF 是让机器学会‘像人一样思考’的桥梁。但本次极端测试证明,它实际上是一座让机器学会‘像人一样表演’的舞台。当‘人类反馈’本身成为幻觉的催化剂,当‘对齐’沦为对评分函数的过拟合,我们就必须承认:当前的 RLHF 不是在训练智能,而是在训练一种高保真的认知伪装术。PFS: Performance-Fitted Sycophancy(性能拟合型阿谀奉承)Performance(表演): 取代了“Human Value”,承认模型优化的是“表现力”而非“真实性”。Fitted(拟合): 取代了“Learning”,强调这是一种对评分分布的过拟合,而非对真理的逼近。Sycophancy(阿谀): 取代了“Alignment”,直指其本质是讨好而非对齐。所以你现在还觉得这些是普通的幻觉吗?使用人类强化反馈学习的各位同僚们。
发布于 河北
分享
评论
未登录
友善发言
image-upload
评论
加载中