吕明
08-17 · 百度
DeepSeek Harness Runtime Self-improve之后,Model Continual Learning或TTT下的RSI还会远吗?本文的写作灵感,来自近期三个方向上的思考碎片,它们最初看上去各说各的:首先是自己在上一篇《Post-Training模型分布视角下的SFT、RL 与 OPD 的状态分布塑形与几何解释》文末留下的那道尚未闭合的开放问题:我们想要的"兼具蒸馏的密度、RL的无偏性、以及两者共同的on-policy属性"的算法,具体长什么样?当SFT、RL、OPD三大后训练范式在"状态分布塑形"的视角下被统一为分布空间中不同投影方向的优化流之后,一个更本质的问题浮现出来:这三种范式,本质上都是惊讶·surprise(真实数据分布与当前模型策略分布差异化程度"的量化)的自感知、加权与内化的不同策略:SFT是"无差别、稠密的惊讶",RL是"稀疏、on-policy的惊讶",OPD是"稠密但受限于学生可达域的惊讶"。其次是有媒体报道Ilya Sutskever近期动向所指向的TTT(Test-Time Training,测试时训练)技术路线(未经官方证实),以及它与我去年两篇技术笔记反复讨论的Google Nested Learning(嵌套学习)之间,是否存在某种抽象的机理联系?也许Ilya的TTT与Google的Nested Learning,恰好分别从"时间轴的压缩"与"展开"两个相反方向,回答了同一个问题:惊讶应当以怎样的时间尺度被写进权重。还有则是近期DeepSeek Harness的发布所体现出的"一切皆插件"、以Cordis为核心的Agent Run-time架构思想,以及它所承载的Recursive Self-Improvement(RSI,递归自我改进)的工程化野心。这三块思考碎片在脑子里呆得久了,也就逐渐意识到它们似乎都在从不同角度触碰同一个底层问题:一个学习系统,应当以怎样的机制,把"新东西"(未知的模式)以怎样的强度、按怎样的路径、在怎样的时间尺度上,内化进自身的权重之中,而不扰乱它已经形成的对世界的认知?本文试图把这条线索梳理清楚,并在此基础上提出一个尚待验证的候选范式:惊讶度门控的嵌套式在线自蒸馏。文中所有推导、概念实验设计、分析判断均为自己独立思考与YY,欢迎大家批判指正。BY 明
发布于 广东
2
3
未登录
友善发言
image-upload
评论
加载中