职位描述
1、推理性能优化:负责Seedance、Seedream、Seed3D等SOTA模型推理链路的端到端性能优化,围绕GPU利用率、推理吞吐(tokens/s)、延迟(TTFT/TPOT)、显存效率等核心指标,系统性地定位瓶颈并推动优化落地;
2、多卡通信优化:设计与优化多卡推理场景下的通信策略(TP/PP/EP),降低集合通信开销,实现通信与计算的高效Overlap,提升多卡线性扩展效率;
3、GPU架构理解与适配:深入理解GPU硬件架构特性,针对新硬件能力做推理策略适配与性能调优,充分释放硬件算力;
4、多模型推理加速:支持多模态(VLM)/视频生成(DiT/VAE)/MoE等多种模型架构的推理加速,设计通用可扩展的优化方案;
5、前沿技术预研:跟踪推理加速前沿方向,推动技术选型与生产落地。
职位要求
1、计算机相关专业本科及以上学历,精通C++/Python中的至少一门,有扎实的系统编程与性能优化基础;
2、熟悉GPU体系结构:理解SM调度、显存层次(HBM/L2/Shared Memory)、计算与访存瓶颈分析模型(如Roofline Model);
3、熟悉Transformer模型推理流程,理解KV Cache、Attention计算模式、Tensor Parallelism通信拓扑等核心概念;
4、具备较强的性能分析能力:能熟练使用性能分析工具,系统性定位计算、访存、通信瓶颈;
5、对推理加速有浓厚兴趣,善于从硬件原理和系统全局出发思考优化策略,有较强的分析和解决问题的能力。
加分项:
1、有大模型推理优化实战经验、有多卡通信优化经验、熟悉多代GPU微架构差异、有跨硬件性能适配经验;
2、有视频生成模型(DiT/VAE)或MoE模型的推理加速经验;
3、熟悉Kubernetes/Docker,有GPU集群资源调度与推理服务部署经验。
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。