吕明
2天前 · 百度
最近看了几页“纸”,越来越觉得不同post-training下分布状态的变化映射到真实环境下pattern探索间的跨周期trade-off正变得越来越“玄幻”呢,且也为不论是RLVR不同的预算策略还是密级奖励下OPD的教师状态的trade-off带来很多持续的不确定性..等忙过这段时间捋捋清楚再跟大伙分享下emoji分享帖子https://taou.cn/a/i76mz6
发布于 北京
分享
2
未登录
友善发言
image-upload
评论
加载中