大语言模型后训练算法工程师
岗位摘要
负责大语言模型后训练(Post-Training)阶段的核心技术研发;构建和优化高质量的奖励系统(Reward System);通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型后训练(Post-Training)阶段的核心技术研发
- 构建和优化高质量的奖励系统(Reward System)
- 通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力
- 深入研究和优化 RLHF等后训练算法,提升模型训练的稳定性和最终效果
- 负责后训练阶段的数据合成与管理
- 设计高效的数据飞轮机制
- 利用SFT、Self-Instruct等技术合成高质量训练数据
- 负责建立从用户反馈(User Feedback)到模型迭代的闭环信号建模体系
- 负责后训练模型的全维度评测与分析
- 制定科学的评价指标
- 跟进前沿技术动态
- 将最新研究成果快速转化为业务价值
任职要求
- 具备计算机科学、人工智能或相关专业的本科及以上学历
- 具有大语言模型后训练、奖励模型构建或强化学习相关的研究或工作经验
- 熟练掌握RLHF、PPO、Reward Modeling等后训练算法及其实现
- 熟悉SFT、Self-Instruct等数据合成技术,具备构建数据飞轮机制的能力
- 具备模型评测体系设计、评价指标制定及模型性能分析的经验
- 熟练使用Python及PyTorch、TensorFlow等深度学习框架
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。