logo
登录 / 注册

RL infra 多城市 多级别 高现金

头像
melody
05-28 · 联合创始人
内部强化学习后训练框架的维护与迭代,支撑万亿参数大模型在推理、智能体场景下的文本及多模态强化学习后训练工作。需协同训练推理引擎团队,结合算法、框架与硬件开展协同优化,持续提升大规模强化学习训练的稳定性与运行效率。 任职者需具备扎实的算法功底与工程落地能力,熟练使用Python、PyTorch及各类性能调优工具。要求深入理解Megatron-LM、vLLM等主流训推引擎,能够排查并解决训推不一致、Rollout长尾等大模型RL训练常见问题,同时掌握强化学习理论,拥有相关实战训练经验。拥有vLLM、VeRL等开源框架贡献经历,或是在强化学习稳定性、规模化训练、长尾问题优化等方向发表顶会论文者,将予以优先考虑
RL infra 多城市 多级别 高现金脉脉
阅读 2
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    全部4条评论
    头像
    杰先生

    关注你了,加不了好友

    05-29
    头像
    杰先生

    请联系一下我

    05-29
    头像
    杰先生

    很适合,这是哪家的

    05-29
    头像
    北先生

    哪一家

    05-28
    头像
    我来说几句...