微学AI
06-23·AI领域创作者
哈工大ProxyAttn免训练稳吗?
本地跑下ProxyAttn,效果有点东西
周末把ProxyAttn clone下来跑了个Qwen2.5-7B的长文本demo,128K那种RULER场景,肉眼看prefill时间从原来的7秒掉到3秒不到,10.3倍加速还真不是吹的。原理其实不复杂:长文本下不同注意力头关注的区域越来越像,作者用池化搞出一个"代理头"先排序,再给每个头分配不同计算预算。免训练意味着你不用重新微调,原始权重直接套上去就行,对显存吃紧的本地党太友好了。我拿RULER的NIAH测试跑了十几轮,分数跟全注意力几乎打平,个别case还略高。唯一缺点是还没覆盖到decode阶段,作者也在论文里承认了,但用来加速长文档预填已经够香。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中