姚尧
08-06 · 北京良机互优咨询有限公司 高级合伙人
AI Infra 2025最全岗位分类
AI Infra作为2025年最热门赛道,岗位缺口大、薪资溢价高,清晰分类+落地转型路径能快速帮你抢占上车窗口。一、7大核心岗位分类1. 分布式训练基础设施工程师:搭建千卡级训练平台,解决通信/显存瓶颈,需掌握PyTorch/Megatron、CUDA、NCCL,适配大厂大模型团队。2. 推理优化与部署工程师:模型落地效率优化,核心技能含vLLM/TRT-LLM、量化剪枝、PD分离,适配互联网/自动驾驶/芯片公司。3. 框架与算子开发工程师:底层技术研发,需C++/Triton、算子融合、MLIR优化,适合框架研发/芯片软件栈组。4. 云原生AI集群管理工程师:基于K8s搭建AI集群,精通GPU调度、分布式存储、RDMA网络,适配云厂商/企业私有集群团队。5. 高性能网络/存储工程师:专注高吞吐低时延传输,需RDMA/DPDK、拥塞控制、分级存储,适配超大规模集群搭建组。6. 多模态数据处理工程师:构建PB级数据流水线,掌握Spark/Flink、数据湖优化,适配多模态大模型/数据中台组。7. 软硬件协同优化工程师:打通模型-框架-硬件壁垒,需芯片架构认知、编译器优化,适配芯片公司生态组。二、分背景转型路径(0-12个月落地)1. 算法/软件开发岗(6-9个月见效)- 技能优先级:CUDA+NCCL→DeepSpeed/Megatron并行机制→vLLM/TRT-LLM优化→基础K8s- 实战项目:搭建带容错的训练demo、量化+KV Cache优化LLaMA模型、贡献开源项目- 求职适配:推理优化、分布式训练岗,中小厂量产岗位薪资溢价更高2. 云原生/运维岗(9-12个月)- 技能优先级:GPU调度策略→RDMA+分布式存储→LLMOps工具链→基础训练框架- 实战项目:搭建GPU分时共享K8s集群、设计AI集群监控体系、优化故障自愈流程- 求职适配:云原生AI集群管理、LLMOps平台岗,大厂与国产云厂商需求旺盛3. 芯片/硬件岗(10-12个月)- 技能优先级:芯片架构→编译器优化→推理引擎适配→分布式通信基础- 实战项目:国产芯片TRT-LLM适配、低比特算子开发、模型跨硬件迁移- 求职适配:软硬件协同、芯片AI生态岗,国产芯片公司薪资比大厂高30-50%
发布于 北京
3
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn