返回岗位列表

月之暗面

强化学习后训练框架工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

维护和开发Moonshot内部的强化学习后训练框架;支持万亿参数模型在推理、智能体等方向的文本与多模态强化学习后训练;与训练推理引擎方向的团队合作,探索算法、框架、硬件的协同设计;提升大规模强化学习训练的稳定性和效率

岗位职责

  • 维护和开发Moonshot内部的强化学习后训练框架
  • 支持万亿参数模型在推理、智能体等方向的文本与多模态强化学习后训练
  • 与训练推理引擎方向的团队合作,探索算法、框架、硬件的协同设计
  • 提升大规模强化学习训练的稳定性和效率

任职要求

  • 具备扎实的工程算法基础和工程实现能力
  • 熟悉Python等编程语言
  • 熟练掌握PyTorch等深度学习框架和常见性能调试/分析工具
  • 对Megatron-LM/vLLM等主流训练推理引擎有深入的了解
  • 对大模型强化学习训练中的实际问题(如训练推理不一致、Rollout长尾等)有排查和解决经验
  • 具备扎实的强化学习算法基础和实际强化学习训练经验

加分项

  • 有出色的开源项目经历(如为vLLM、VeRL等框架提交过重要PR)、对口的顶会发表者(如RL稳定性、环境scaling、长尾问题解决等Paper)优先
  • 业界知名RL框架经验(如verl、roll、slime等) / 开源项目贡献者 / 顶会paper