福大大架构师每日一题
06-22·AI领域创作者
AI创作者AMA知无不言
面向分布偏移下经校准的混合专家模型合专家(MoE)是应用广泛的模型架构,其核心思路是将复杂学习任务拆解为多个简单、专业化的子任务。在MoE架构中,路由模块会将输入样本分配至单个专家(硬路由),或是分配给多个专家加权融合(软路由)。该结构天然支持条件计算:每个输入仅激活部分模型参数,因此可以在不按比例增加计算开销的前提下扩充模型容量[7,5,27]由于不同专家基于不同样本子集完成训练,MoE会驱动各专家在异构数据的不同子空间形成专业适配能力[13,2,10]。兼具高效扩容能力与专家专业化特性,使得MoE成为当前各类大规模学习系统的标准基础模块[20,2,14]MoE将预测任务拆分至共享输入空间的多个专家,因此普遍存在一种直观认知:该架构对输入空间样本分布偏移具备鲁棒性。举例而言,若MoE内置擅长数学、擅长历史两类可靠专家,即便训练数据以历史题型为主、测试数据以数学题型为主,人们会自然认为整体模型预测结果依然可信。但本文证明,这一直观认知存在误区:即便每个独立专家的预测都可靠,发生分布偏移时,软路由MoE的聚合预测结果仍会出现系统性可信度失效。更精确地说:当训练集与测试集的路由分配模式存在差异时,即便每个专家在自身路由分配到的样本子集上完全校准,软路由MoE整体依然会出现失准问题。根本原因在于:软路由会将一组路由权重与专家预测值压缩为单一聚合置信度,而多组完全不同的路由+专家预测组合,最终可以输出相同的聚合置信值。训练分布下的校准仅要求:输出同一置信度的各类组合出现比例,加权平均后的标签频率等于;并不要求每一组组合单独的标签频率严格等于。因此,破坏校准效果的分布偏移可以十分轻微:这类偏移无需引入全新样本、无需改变条件标签概率、无需改动任意样本在单个专家上的预测结果,仅需改变不同路由组合的出现频次即可。在该类偏移下,原本各自校准的专家加权融合后,整体模型置信度将与真实预测准确率脱节。
发布于 北京
1
评论
1
未登录
友善发言
image-upload
评论
加载中