荣誉称号0731
08-13·设计师·1年
适用于 MoE、训练、推理等多种负载
模型与公式推导设总执行时间 T 由两部分组成:T = T_{\text{move}} + T_{\text{compute}}其中 T_{\text{move}} 为数据搬运时间,T_{\text{compute}} 为计算时间。定义搬运时间占比:f = \frac{T_{\text{move}}}{T_{\text{move}} + T_{\text{compute}}}若通过某种优化手段(如通信压缩、量化、缓存优化等)将数据搬运时间压缩至原来的 1/k(k>1),而计算时间不变,则优化后总时间为:T' = \frac{T_{\text{move}}}{k} + T_{\text{compute}}加速比 S 为:S = \frac{T}{T'} = \frac{T_{\text{move}} + T_{\text{compute}}}{T_{\text{move}}/k + T_{\text{compute}}}将分子分母同除以 T_{\text{move}} + T_{\text{compute}},并代入 f,得到:\boxed{S = \frac{1}{(1-f) + f/k}}当 k \to \infty(完全消除数据搬运)时,加速比上限为:S_{\max} = \frac{1}{1-f}该式表明:数据搬运占比 f 决定了优化的理论空间。f 越高,优化数据搬运的收益越大;反之,计算占比越高,收益越有限。3. 典型场景分析3.1 MoE 模型MoE(混合专家)中单个专家的计算量小,但 token 路由与专家参数搬运量大,f 极高(接近 1)。若通过通信压缩或调度将搬运量减少至约 1/6(k \approx 6),则:S \approx \frac{1}{0 + 1/6} = 6该结果与部分系统实测一致。3.2 小 batch 推理小 batch 推理受限于内存带宽,搬运时间占主导,f 接近 1。若采用量化将数据量减少至 1/4(k=4),则理论加速比:S \approx \frac{1}{0 + 1/4} = 4实际系统中,由于量化/解量化引入额外计算,加速比会略低于理论值,但仍与公式预测趋势一致。
发布于 广东
分享
1
1
未登录
友善发言
image-upload
评论
加载中