潘承乖
07-17 · 贝塔无限智能科技有限公司·招聘人事
AI Infra 研发工程师(训练 + 仿真 + 推理综合型)职位描述负责千卡级 GPU 集群上具身智能相关的大规模训练平台研发、全链路性能与低精度优化、RL 及世界模型训练链路建设、仿真基础设施与并行 rollout 构建、Sim-to-Real 与真机数据闭环搭建、端侧推理与模型优化,协同算法团队完成完整研发闭环,并构建支持多类训练范式的统一训练框架与工具链。职位要求3-8 年 AI Infra / 分布式训练 / 推理引擎 / 机器人平台任一方向的工程经验;计算机、机器人、自动化等相关专业硕士优先。- 具备千卡级 GPU 训练实战经验,熟悉大规模训练常见问题(loss spike、通信阻塞、checkpoint 长尾、慢节点、nccl调优等)与解决方案;精通 PyTorch 分布式训练机制(DDP / FSDP),熟悉 DeepSpeed 或 Megatron-LM 至少其一的原理与源码。- 熟悉 Isaac Sim / Isaac Lab / MuJoCo / SAPIEN / Genesis 中的一项,能独立搭建并行 rollout、Sim-to-Real 或合成数据 pipeline;理解物理仿真的常见 gap 与工程处理方法。- 熟悉至少一个主流推理框架源码(TensorRT / vLLM / SGLang / ONNX Runtime / TVM),理解常见网络结构的推理特性与量化误差控制方法;具备端侧或云端推理服务化实操经验。- 熟练掌握 CUDA、C++、Python;熟悉 K8s 或 Slurm 上的训练/仿真任务编排;具备端到端交付经验,对训练效率、仿真吞吐、推理延迟三类指标有一定优化经验。加分项- 具身智能真实项目经验,理解 VLA、Diffusion Policy、World Model、RL(BC / PPO / SAC / DAPG / HIL)等数据流。- 熟悉 lerobot、GR00T、Open X-Embodiment、DROID、FluxVLA Engine 等主流具身数据 / 框架,或有开源贡献。- JAX + TPU 经验、Megatron-Core / TransformerEngine 深度使用经验、RL 训练系统经验。- ROS / ROS2、DDS 流式数据,或机器人 fleet 数据平台建设经验(对标 Figure Helix、1X)。- 熟悉编译器 / 图优化(MLIR、TorchDynamo / Inductor)、低精度训练(BF16 / FP8 / INT8)与数值稳定性验证;顶会 / 顶刊(MLSys、OSDI、RSS、CoRL)论文或开源社区贡献者优先。
发布于 广东
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn