橘子在皇后镇看景色
07-02·人力HR·10年+
英伟达SparDA预取有用吗?
线上跑百万级长上下文推理,最卡性能的就是CPU显存交换的PCIe延迟。传统稀疏注意力要等到计算层才确定需要哪些KV块,数据搬运全程阻塞解码流程。SparDA靠前置Forecast分支提前预判下一层所需缓存,预取和当前层计算并行执行。8B稀疏模型实测解码速度能提1.7倍,单卡还能承载更大批量请求。只新增不到0.5%参数,精度几乎无损耗,文档解析、代码库通读这类业务收益很实在。显存不够只能把KV缓存外放的集群,这套预取机制属于刚需优化。
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中