返回岗位列表

智谱AI

GLM团队-后训练 RLHF 算法工程师

地点:北京 薪资:30-60K 日期:2026-05-08

岗位摘要

负责对齐数据的优化工作,包括针对模型特定能力进行数据构造、筛选和优化,涵盖指令遵循、逻辑性、角色扮演等特定领域的数据筛选和合成,以及对齐数据的质量和多样性控制;探索后训练扩展性,研究模型如何通过思维链推理在通用领域任务上取得更优效果

岗位职责

  • 负责对齐数据的优化工作,包括针对模型特定能力进行数据构造、筛选和优化,涵盖指令遵循、逻辑性、角色扮演等特定领域的数据筛选和合成,以及对齐数据的质量和多样性控制
  • 探索后训练扩展性,研究模型如何通过思维链推理在通用领域任务上取得更优效果
  • 进行强化学习算法优化,提升后训练scaling性能,优化多目标奖励模型、生成式奖励模型和过程监督奖励模型
  • 结合RLHF、RLAIF、self-improve等技术进行对齐范式探索,推动训练优化方法的持续创新

任职要求

  • 2026届毕业生,自然语言处理、机器学习、人工智能、软件工程等相关专业硕士及以上学历
  • 具备较强的算法开发能力,熟悉常用的机器学习、深度学习算法原理
  • 熟练使用Pytorch、Huggingface、Megatron等深度学习框架
  • 对Transformer架构有深入理解,了解其各种变体,有相关研究经验者优先
  • 具备优秀的代码能力和基础算法功底,有大规模训练或大规模数据处理的工程经验

加分项

  • 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先
  • 熟悉并行训练框架,有多机多卡训练经验者优先
  • 熟悉大模型预训练 / SFT / RL 者优先
  • 李女士 刚刚活跃

福利待遇

  • 具有竞争力的薪酬待遇:30-60K·16薪
  • 加入国内最早从事大模型预训练的顶尖团队,获得专业成长机会
  • 充沛的计算资源支持,支持预训练和后训练的深度探索
  • 参与国际一流水平的大模型研发,工作成果具有全球影响力
  • 团队氛围开放,鼓励技术创新和前沿探索

工作地址

北京海淀区智谱华章科技有限公司1