夜勤月
07-02·AI领域创作者
英伟达SparDA预取有用吗?
SparDA有用,但别无脑上
我上周刚踩完坑。组里新人看到英伟达SparDA论文,128K上下文吞吐量5.3倍,直接往稠密对话模型上套,跑出来性能反而退了2%。我看了眼ncu报告——SM idle不到4%,纯计算bound,预取个寂寞。SparDA本质是帮你把CPU内存里的KV缓存提前搬到GPU,省的是PCIe传输的等待时间。你得先确认自己是不是IO-bound,不是就别来凑热闹。实测下来,跑MoE长序列推理确实香,延迟降10-20%;但稠密短对话场景,多一步预测反而吃开销。先profile再优化,这步省不掉。
发布于 江西
7
14
9
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn