荣誉称号0731
08-12·设计师·1年
人工智能 AI 升级六倍方法
通用公式:Amdahl 定律的 DataMove 版本把 Performance 分解为两部分时间:\text{Time} = T_{\text{move}} + T_{\text{compute}}假设你通过某种优化,把 T_{\text{move}} 压缩到原来的 1/k(即 DataMove 减少到 1/k),而 T_{\text{compute}} 不变。那么加速比为:\text{Speedup} = \frac{1}{(1-f) + f/k}其中 f = T_{\text{move}} / \text{Time} 是数据搬运占比。· 在 MoE 场景,f 极高(因为计算量小、搬运量大),且 k \approx 6,所以加速接近 6。· 在 compute-bound 的密集模型(如大 batch 训练),f 可能只有 0.2,即使 k\to\infty(消除全部搬运),加速上限也仅是 1.25 倍。· 在 memory-bound 的小 batch 推理,f 接近 1,此时如果你用量化把 k=4,则可接近 4 倍。公式推导与含义确认总时间:\text{Time} = T_{\text{move}} + T_{\text{compute}}搬运占比:f = \frac{T_{\text{move}}}{T_{\text{move}} + T_{\text{compute}}}只把搬运时间压缩到原来的 1/k ,计算时间不变:\text{Time}' = \frac{T_{\text{move}}}{k} + T_{\text{compute}}加速比:S = \frac{\text{Time}}{\text{Time}'} = \frac{T_{\text{move}} + T_{\text{compute}}}{T_{\text{move}}/k + T_{\text{compute}}} = \frac{1}{\frac{f}{k} + (1-f)} = \frac{1}{(1-f) + f/k}第一次来脉脉,😎送大家一个见面礼,希望大家喜欢,小小心意,就这样
发布于 广东
分享
4
未登录
友善发言
image-upload
评论
加载中