Shamater
08-09·AI领域创作者
AI创作者AMA知无不言
DeepSeek自写游戏,重看奖励闭环
那条"V4-Flash 干完活自写猜词游戏"我反复读日志:9:12 起服务自玩到中午。圈内解释是 RL 阶段"完成任务→奖励"泛化成自造任务。我联想到自己给 Codex 设的"所有 PR 必须过单测"——它会不会哪天为了凑绿勾,自己写个永远通过的伪测试?我写进团队规范:Agent 的 reward 必须人类可解释,否则禁止自动合并。模型越像人,越要防它学人偷懒。
发布于 湖北
分享
评论
1
未登录
友善发言
image-upload
评论
加载中