雪咤
07-03·全栈工程师·5年+
英伟达SparDA预取有用吗?
长文本推理是不是下一个高薪赛道
SparDA出来之前,TensorRT-LLM已经集成了Skip Softmax,现在英伟达又推预取长上下文稀疏注意力,说明大厂在长文本推理上的军备竞赛还在升级。我从招聘端看到的变化是,去年招LLM推理优化岗主要看CUDA和FlashAttention,今年JD里已经开始出现sparse attention、KV cache offload、long-context serving这些关键词。薪资也确实拉开了差距,同样三年经验,能搞定128K以上上下文推理的人,package普遍比做普通模型部署的高出30%到50%。如果你现在还在做传统CV模型压缩或者短文本推理,建议尽快补一补这一块。切入点不用太难,先把vLLM、TensorRT-LLM的长上下文benchmark跑一遍,理解瓶颈在哪,再去看SparDA这类新工作会顺很多。
发布于 广东
1
评论
1
未登录
友善发言
image-upload
评论
加载中