返回岗位列表

腾讯

大语言模型后训练算法工程师

地点:深圳 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责大语言模型后训练(Post-Training)阶段的核心技术研发;构建和优化高质量的奖励系统(Reward System);通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力

岗位职责

  • 负责大语言模型后训练(Post-Training)阶段的核心技术研发
  • 构建和优化高质量的奖励系统(Reward System)
  • 通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力
  • 深入研究和优化 RLHF等后训练算法,提升模型训练的稳定性和最终效果
  • 负责后训练阶段的数据合成与管理
  • 设计高效的数据飞轮机制
  • 利用SFT、Self-Instruct等技术合成高质量训练数据
  • 负责建立从用户反馈(User Feedback)到模型迭代的闭环信号建模体系
  • 负责后训练模型的全维度评测与分析
  • 制定科学的评价指标
  • 跟进前沿技术动态
  • 将最新研究成果快速转化为业务价值

任职要求

  • 具备计算机科学、人工智能或相关专业的本科及以上学历
  • 具有大语言模型后训练、奖励模型构建或强化学习相关的研究或工作经验
  • 熟练掌握RLHF、PPO、Reward Modeling等后训练算法及其实现
  • 熟悉SFT、Self-Instruct等数据合成技术,具备构建数据飞轮机制的能力
  • 具备模型评测体系设计、评价指标制定及模型性能分析的经验
  • 熟练使用Python及PyTorch、TensorFlow等深度学习框架