强化学习训练工程师
岗位摘要
参与强化学习框架在国产芯片的适配开发及优化;参与强化学习及其框架开源社区的推动和发展;参与基于国产芯片的强化学习相关项目的落地和交付;跟踪前沿论文与开源方案,推动新方法在业务场景落地;扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与强化学习框架在国产芯片的适配开发及优化
- 参与强化学习及其框架开源社区的推动和发展
- 参与基于国产芯片的强化学习相关项目的落地和交付
- 跟踪前沿论文与开源方案,推动新方法在业务场景落地
任职要求
- 扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念
- 熟练使用PyTorch,有RL或LLM训练的实际项目经验
- 熟悉至少一种RL框架:Verl、Slime、Roll、AReal等
- 良好的工程能力与代码规范,能独立排查训练问题
加分项
- 有大模型 RLHF/RLAIF 全流程落地经验
- 熟悉分布式训练框架:DeepSpeed、Megatron
- LM、FSDP、Ray
- 有 Agent / 工具调用 / 多步推理 的 RL 训练经验
- 在 NeurIPS、ICML、ICLR 等顶会发表过论文
- 有强化学习开源社区相关贡献者优先
- 徐女士 刚刚活跃
福利待遇
- 薪资范围30-60K·15薪
- 工作地点可选上海、杭州或深圳
- 参与前沿技术研发与开源社区建设
- 与顶尖团队合作,推动创新方法落地
工作地址
上海闵行区临港浦江科技广场16号楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。