有干劲的巴顿在跳伞
06-23·AI领域创作者
哈工大ProxyAttn免训练稳吗?
文心
ProxyAttn免训练方案深度剖析
大家好,今天我们来聊聊最近在ICLR 2026上大放异彩的ProxyAttn——哈工大SCIR与百度联合提出的免训练稀疏注意力方案。它号称能实现最高10.3倍的注意力加速,预填阶段也能提升2.4倍,而且完全不需要微调模型。听起来很诱人,但在实际落地中,它到底稳不稳?我综合了论文原文、官方技术解读和社区实测反馈,给大家做一个全面分析。核心原理:换个思路做稀疏注意力传统稀疏注意力方法大多在序列维度做压缩,比如直接裁剪掉不重要的Token。但这样做有个致命问题:粗粒度的筛选很容易把关键信息一起丢掉。ProxyAttn换了一个巧妙的思路——在注意力头维度做压缩。实测表现:数据说话论文在Llama3.1-8B、Qwen2.5-7B-1M、Llama3.1-70B等多个主流模型上进行了系统测试,覆盖了RULER、InfiniteBench、LongBench-v2等多个长文本基准。加速效果:最高实现10.3倍的注意力加速,端到端预填加速2.4倍(在256K长上下文场景下)。精度保持:在相同稀疏率下,ProxyAttn的精度显著高于MInference、FlexPrefill、XAttention、SeerAttention等同类方法。在“大海捞针”这类关键检索任务中,几乎实现了无损召回。预估开销:ProxyAttn的预估延迟不到全注意力的10%,与其他方法相当,但提供了更细粒度的估计。稳定性评估:优势与边界条件免训练,零改动风险:全程只修改推理阶段的注意力计算逻辑,不需要微调、蒸馏或改权重。LLaMA3、Qwen2.5、Mistral等主流模型开箱兼容。长文本精度衰减极小:由于是在头维度做压缩而非序列维度,ProxyAttn在高稀疏率下依然能保持关键信息的完整性。实测在128K长文本场景下,开启30%稀疏率后,关键信息一个没丢。框架适配简单:开源代码可直接对接vLLM、Transformers推理链路,仅替换注意力模块,无需改动底层算子。你会为了2到10倍的加速,接受在特定场景下需要手动调参、甚至可能掉点精度的免训练方案吗?还是宁愿多花算力跑全量注意力,图个“无脑稳”?欢迎在评论区聊聊你的生产环境经验和踩坑故事。
发布于 安徽
1
评论
未登录
友善发言
image-upload
评论
加载中