大模型RL Infra研究工程师
岗位摘要
维护和开发Moonshot内部的强化学习后训练框架;支持万亿参数模型在reasoning、agentic等方向的文本及多模态RL后训练;与训练推理引擎团队合作,探索算法、框架、硬件的协同设计
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 维护和开发Moonshot内部的强化学习后训练框架
- 支持万亿参数模型在reasoning、agentic等方向的文本及多模态RL后训练
- 与训练推理引擎团队合作,探索算法、框架、硬件的协同设计
- 提升大规模强化学习训练的稳定性和效率
任职要求
- 有扎实的工程算法基础和工程实现能力
- 熟悉Python等编程语言
- 熟练掌握Pytorch等深度学习框架和常见性能调试/分析工具
- 对Megatron-LM/vLLM等主流训推引擎有深入了解
- 对大模型RL训练中的实际问题(如训推不一致、Rollout长尾等)排查和解决有经验
- 有扎实的强化学习算法基础和实际RL训练经验
- 硕士及以上学历
加分项
- 有出色的开源项目经历(如为vLLM、VeRL等框架提交过重要PR)、对口的顶会发表者(如RL稳定性、环境scaling、长尾问题解决等Paper)优先
- 目标画像:业界知名RL框架团队(如verl、roll、slime等) > 开源项目贡献者 > 顶会paper > 其他
- 宋女士 本周活跃
福利待遇
- 月薪55-85K,16薪
- 业界知名AI公司发展平台
- 参与万亿参数大模型核心技术研发
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。