夜勤月
07-02·AI领域创作者
英伟达SparDA预取有用吗?
SparDA有用,但别无脑上
我上周刚踩完坑。组里新人看到英伟达SparDA论文,128K上下文吞吐量5.3倍,直接往稠密对话模型上套,跑出来性能反而退了2%。我看了眼ncu报告——SM idle不到4%,纯计算bound,预取个寂寞。SparDA本质是帮你把CPU内存里的KV缓存提前搬到GPU,省的是PCIe传输的等待时间。你得先确认自己是不是IO-bound,不是就别来凑热闹。实测下来,跑MoE长序列推理确实香,延迟降10-20%;但稠密短对话场景,多一步预测反而吃开销。先profile再优化,这步省不掉。
发布于 江西
7
14
9
未登录
友善发言
image-upload
评论
加载中