大语言模型后训练工程师
岗位摘要
负责大语言模型后训练(Post-Training)阶段的核心技术研发;构建和优化高质量的奖励系统(Reward System);通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力
岗位职责
- 负责大语言模型后训练(Post-Training)阶段的核心技术研发
- 构建和优化高质量的奖励系统(Reward System)
- 通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力