七夜zippoe
08-13·AI领域创作者
AI创作者AMA知无不言
大模型蒸馏通病被根治!
做推理、代码大模型微调的同行应该都踩过 OPSD 自蒸馏的坑:训练时模型能看到标准答案,推理无参考时却凭空编造答案,业内叫「特权幻觉」,越训练推理正确率反而下滑。团队定位根源是师生模型信息不对称,老师掌握答案、纯推理学生没有,模仿出捷径式虚假推导。提出 DAPD 双锚点蒸馏框架,靠双路径、双来源两层锚定消除信息差。增设自我分布作为中间桥梁,一边对齐真实推理场景,一边匹配带答案的教师信号;同时平衡标准答案与模型自生成轨迹的训练权重,小模型侧重标准答案,大模型更多吸收自身推理逻辑。多套数学、代码、指令基准实测,各参数规模模型稳定优于原版 OPSD,大模型提升优势更突出。推理阶段无额外开销,仅训练增加少量计算,就算无标准答案,依靠模型多轮生成样本训练也能带来正向收益,对推理类模型落地优化价值很高。
发布于 山西
1
评论
未登录
友善发言
image-upload
评论
加载中