返回岗位列表

腾讯

大语言模型后训练工程师

地点:深圳 薪资:薪资未公开 日期:未知

岗位摘要

负责大语言模型后训练(Post-Training)阶段的核心技术研发;构建和优化高质量的奖励系统(Reward System);通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力

岗位职责

  • 负责大语言模型后训练(Post-Training)阶段的核心技术研发
  • 构建和优化高质量的奖励系统(Reward System)
  • 通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力