logo
登录 / 注册

多模态大模型推理框架优化工程师

头像
艾优程 Anya
06-03 · 高级猎头顾问
职位描述 1、推理性能优化:负责Seedance、Seedream、Seed3D等SOTA模型推理链路的端到端性能优化,围绕GPU利用率、推理吞吐(tokens/s)、延迟(TTFT/TPOT)、显存效率等核心指标,系统性地定位瓶颈并推动优化落地; 2、多卡通信优化:设计与优化多卡推理场景下的通信策略(TP/PP/EP),降低集合通信开销,实现通信与计算的高效Overlap,提升多卡线性扩展效率; 3、GPU架构理解与适配:深入理解GPU硬件架构特性,针对新硬件能力做推理策略适配与性能调优,充分释放硬件算力; 4、多模型推理加速:支持多模态(VLM)/视频生成(DiT/VAE)/MoE等多种模型架构的推理加速,设计通用可扩展的优化方案; 5、前沿技术预研:跟踪推理加速前沿方向,推动技术选型与生产落地。 职位要求 1、计算机相关专业本科及以上学历,精通C++/Python中的至少一门,有扎实的系统编程与性能优化基础; 2、熟悉GPU体系结构:理解SM调度、显存层次(HBM/L2/Shared Memory)、计算与访存瓶颈分析模型(如Roofline Model); 3、熟悉Transformer模型推理流程,理解KV Cache、Attention计算模式、Tensor Parallelism通信拓扑等核心概念; 4、具备较强的性能分析能力:能熟练使用性能分析工具,系统性定位计算、访存、通信瓶颈; 5、对推理加速有浓厚兴趣,善于从硬件原理和系统全局出发思考优化策略,有较强的分析和解决问题的能力。 加分项: 1、有大模型推理优化实战经验、有多卡通信优化经验、熟悉多代GPU微架构差异、有跨硬件性能适配经验; 2、有视频生成模型(DiT/VAE)或MoE模型的推理加速经验; 3、熟悉Kubernetes/Docker,有GPU集群资源调度与推理服务部署经验。
多模态大模型推理框架优化工程师脉脉
阅读 1
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...