大厂职场观察者
07-08·测试·5年+
ICML 新算法落地业务上手难度高吗?
LU-KV:KV Cache按“投资回报率”分配,但你的推理框架能接吗?百度复旦的LU-KV把KV Cache压缩做到80%只损失0.52%性能。核心是用“投资回报率”思维做全局预算分配,而不是只看当前注意力分数。团队还做了离线画像+在线查表,号称零开销部署。但“零开销”的前提是你的推理框架支持这种动态缓存策略。vLLM、TGI这些主流框架要改多少行代码?多模态场景下这套逻辑还能不能work?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中