【关于我们】
算力支持:每年等效算力投入预算上亿元
业界标杆:产出SuperGPQA、OmniDocBench、VeriGUI等数十个卜标杆测试基准,被Google、DeepSeek、Qwen等头部模型团队广泛引用
顶级成果:团队研究成果持续命中 NeurlPS、ICML、ICCV、CVPR等顶级学术会议
【岗位职责】
- 负责大模型评测体系与Benchmark路线规划,覆盖代码、推理、多模态、Agent与安全评测等方向,沉淀学术论文、技术报告和标准化评测规范。
- 主导自动化评测平台与工具链建设。
- 主导数据集质量评测体系建设,推动数据质量闭环优化。
- 负责新模型的系统化评测、横向对比与失败案例分析,将评测结论转化为训练和数据优化方案。
【任职要求】
- 硕士及以上学历,计算机、人工智能、数学、统计等相关专业优先。
- 以主要作者身份发表过Benchmark、Dataset、LLM Evaluation 或相关方向的顶会/顶刊论文,具备完整评测集设计、实验验证与论文产出经验。
- 具备大模型训练或后训练相关经验,理解SFT、RLHF/RLAIF、DPO/PPO/GRPO、Reward Model、Verifier等方
法及其评测需求。
- 熟悉主流大模型、Reasoning Model、多模态模型与Agent的能力边界、训练目标和评测范式,了解常见Benchmark与自动化评测框架。
- 具备扎实的Python工程能力、数据分析能力和中英文技术写作能力,能够独立完成评测实验设计、结果分析、技术报告和论文材料撰写。
【优先条件】
- 有公开Benchmark、Leaderboard、评测平台或开源评测工真的核心建设经验。
- 有大模型训练、后训练、对齐或评测闭环项目经验。
- 具备团队管理或技术负责人经验。
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。