单纯的小河马放牧
07-02·AI领域创作者
英伟达SparDA预取有用吗?
SparDA是英伟达和MIT等机构刚提出的一项技术,简单说就是给AI长文本推理装了个"预言家"。处理超长文本时,AI需要频繁在GPU和CPU之间搬运数据,PCIe传输成了瓶颈。SparDA的思路是在模型每层加一个极轻量的"预报"投影(不到0.5%参数量),提前预测下一层需要哪些数据块并预取过来,让搬运和计算并行不误。实测在128K长上下文下,解码速度提升1.7倍,吞吐量最高达到5.3倍,精度还不降反升。对于做大模型推理的同行来说,这相当于花极小成本把显存瓶颈松绑了。
发布于 江苏
分享
评论
未登录
友善发言
image-upload
评论
加载中