AI天才猎头LionKing
06-23 · 亦非人力猎头顾问
agent后训练算法工程师
Agent后训练算法工程师和VLM 预训练数据算法工程师岗位职责1.Agent 后训练算法设计与实现:主导基模大模型的 Agent 化后训练方案研发,包括指令微调(SFT)、奖励模型(RM)训练、强化学习(RLHF/RLAIF)优化,聚焦任务规划、记忆机制、工具调用、多轮对话一致性等核心能力提升。;2.后训练数据体系构建:设计 Agent 后训练数据的采集、清洗、标注与迭代策略,涵盖通用指令集、任务型对话数据、工具调用样本、多模态交互数据等,建立数据质量评估与筛选机制,优化数据分布与多样性。;3.Agent 能力优化与突破:针对 Agent 在复杂任务拆解、跨领域知识迁移、动态环境适配等场景的痛点,研发创新后训练算法(如分层任务规划训练、多智能体协作训练、反幻觉优化),提升 Agent 的决策准确性与鲁棒性。;4.工程化落地与系统协作:搭建高高效后训练流水线,支持大规模数据并行处理、分布式训练(DDP/FSDP)与模型压缩部署;与产品、工程团队协作,打通 “后训练 - 评测 - 迭代” 闭环,适配不同场景下的 Agent 产品需求。;5.技术创新与沉淀:跟踪大模型 Agent 领域前沿技术(如 LLM+Planning、Tool Learning、Multi-Agent Interaction),主导核心技术攻关与专利申请;输出可复用的后训练算法组件、技术文档与评测基准,推动团队技术能力沉淀。岗位要求1.计算机科学、人工智能、机器学习等相关专业硕士及以上学历,1年以上大模型后训练或 Agent 相关研发经验。;2.扎实的算法基础:精通深度学习、强化学习、自然语言处理核心理论,深入理解大模型训练原理、Transformer 架构及 Agent 决策机制。;3.工程能力扎实:熟练掌握 Python 编程语言,精通 PyTorch/TensorFlow 框架及 HuggingFace 生态,具备大规模数据处理(Spark/Flink)与分布式训练(DDP/FSDP/DeepSpeed)实战经验。;4.后训练实战经验:具备大模型指令微调、RLHF/RLAIF、奖励模型训练等后训练全流程经验,熟悉 Agent 任务规划、工具调用等核心场景的训练优化方法。。
发布于 浙江
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn