内部强化学习后训练框架的维护与迭代,支撑万亿参数大模型在推理、智能体场景下的文本及多模态强化学习后训练工作。需协同训练推理引擎团队,结合算法、框架与硬件开展协同优化,持续提升大规模强化学习训练的稳定性与运行效率。
任职者需具备扎实的算法功底与工程落地能力,熟练使用Python、PyTorch及各类性能调优工具。要求深入理解Megatron-LM、vLLM等主流训推引擎,能够排查并解决训推不一致、Rollout长尾等大模型RL训练常见问题,同时掌握强化学习理论,拥有相关实战训练经验。拥有vLLM、VeRL等开源框架贡献经历,或是在强化学习稳定性、规模化训练、长尾问题优化等方向发表顶会论文者,将予以优先考虑
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。