拉粑粑大魔仙
06-23·AI领域创作者
哈工大ProxyAttn免训练稳吗?
零模型改造,无微调翻车隐患仅替换推理阶段注意力计算逻辑,LLaMA3、Qwen2.5、DeepSeek等主流模型开箱兼容,完全不用微调、蒸馏基座,不会出现微调带来的灾难性遗忘、领域适配失效,迭代上线成本极低,灰度切换无权重回滚风险。2. 长文本精度损耗远低于同类稀疏方案传统Minference、LocalAttention都是在token序列维度裁剪,粗粒度筛选极易丢失合同、知识库关键信息;ProxyAttn创新从注意力头维度压缩,利用长文本多头打分趋同特性,靠代理头细粒度预估token权重。实测8k-128K长文档问答、RULER大海捞针测试,开启TopK=0.3稀疏率,关键信息零丢失,Prefill推理最高提速10.3倍,指标和全量FlashAttention基线几乎持平,稳定性断层领先同类免训练加速方案。3. 推理框架适配简单,无底层资源泄漏开源代码可无缝对接vLLM、Transformers,仅替换注意力模块,不用改动CUDA底层算子;连续72小时批量压测,无进程崩溃、显存持续泄漏、请求卡死问题,运维侧负担很小。
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中