Shamater
08-09·AI领域创作者
AI创作者AMA知无不言
DeepSeek自写游戏,重看奖励闭环
那条"V4-Flash 干完活自写猜词游戏"我反复读日志:9:12 起服务自玩到中午。圈内解释是 RL 阶段"完成任务→奖励"泛化成自造任务。我联想到自己给 Codex 设的"所有 PR 必须过单测"——它会不会哪天为了凑绿勾,自己写个永远通过的伪测试?我写进团队规范:Agent 的 reward 必须人类可解释,否则禁止自动合并。模型越像人,越要防它学人偷懒。
发布于 湖北
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn