GLM团队-后训练 RLHF 算法工程师
岗位摘要
负责对齐数据的优化工作,包括针对模型特定能力进行数据构造、筛选和优化,涵盖指令遵循、逻辑性、角色扮演等特定领域的数据筛选和合成,以及对齐数据的质量和多样性控制;探索后训练扩展性,研究模型如何通过思维链推理在通用领域任务上取得更优效果
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责对齐数据的优化工作,包括针对模型特定能力进行数据构造、筛选和优化,涵盖指令遵循、逻辑性、角色扮演等特定领域的数据筛选和合成,以及对齐数据的质量和多样性控制
- 探索后训练扩展性,研究模型如何通过思维链推理在通用领域任务上取得更优效果
- 进行强化学习算法优化,提升后训练scaling性能,优化多目标奖励模型、生成式奖励模型和过程监督奖励模型
- 结合RLHF、RLAIF、self-improve等技术进行对齐范式探索,推动训练优化方法的持续创新
任职要求
- 2026届毕业生,自然语言处理、机器学习、人工智能、软件工程等相关专业硕士及以上学历
- 具备较强的算法开发能力,熟悉常用的机器学习、深度学习算法原理
- 熟练使用Pytorch、Huggingface、Megatron等深度学习框架
- 对Transformer架构有深入理解,了解其各种变体,有相关研究经验者优先
- 具备优秀的代码能力和基础算法功底,有大规模训练或大规模数据处理的工程经验
加分项
- 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先
- 熟悉并行训练框架,有多机多卡训练经验者优先
- 熟悉大模型预训练 / SFT / RL 者优先
- 李女士 刚刚活跃
福利待遇
- 具有竞争力的薪酬待遇:30-60K·16薪
- 加入国内最早从事大模型预训练的顶尖团队,获得专业成长机会
- 充沛的计算资源支持,支持预训练和后训练的深度探索
- 参与国际一流水平的大模型研发,工作成果具有全球影响力
- 团队氛围开放,鼓励技术创新和前沿探索
工作地址
北京海淀区智谱华章科技有限公司1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。