微学AI
07-02·AI领域创作者
英伟达SparDA预取有用吗?
跑通SparDA那晚
作为一个常年在本地折腾大模型推理的开发者,我必须说一句:SparDA发布那天晚上我就去GitHub上把NVlabs/SparDA拉了下来。说出来不怕丢人——在这之前我本地跑8B模型处理64K以上长文,每次都得小心翼翼盯着显存温度,PCIe总线一报警就赶紧关窗口,否则就是漫长的等待。SparDA论文里那组数据我在实测里得到了验证:相比普通的稀疏+offload基线,decode速度确实能提到接近2倍;但更让我震撼的是那个5.3×的decode吞吐,因为它不是来自更快的计算,而是来自"终于能塞下更大batch"这件事。GQA组共享一个Forecast头这个设计也救了我——我之前担心每层多一个投影会让显存爆掉,结果实际只增加不到半个百分点的参数。最让我意外的是那段"持久化UVA Triton kernel"异步预取的实现,host-to-device的传输在主kernel执行期间悄悄进行,profile里看就是干净的重叠。我盯着nvidia-smi的曲线看了很久,那是一种久违的、属于系统优化的"安静感"——没有报错,没有oom,只有token一个一个稳定地吐出来。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中