返回岗位列表

壁仞科技

强化学习算法工程师

地点:上海 薪资:薪资未公开 日期:2026-07-20

岗位摘要

参与强化学习框架在国产芯片的适配开发及优化;参与强化学习及其框架开源社区的推动和发展;参与基于国产芯片的强化学习相关项目的落地和交付;跟踪前沿论文与开源方案,推动新方法在业务场景落地;扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念

岗位职责

  • 参与强化学习框架在国产芯片的适配开发及优化
  • 参与强化学习及其框架开源社区的推动和发展
  • 参与基于国产芯片的强化学习相关项目的落地和交付
  • 跟踪前沿论文与开源方案,推动新方法在业务场景落地

任职要求

  • 扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念
  • 熟练使用 PyTorch,有 RL 或 LLM 训练的实际项目经验
  • 熟悉至少一种 RL 框架:Verl、Slime、Roll、AReal 等
  • 良好的工程能力与代码规范,能独立排查训练问题

加分项

  • 有大模型 RLHF/RLAIF 全流程落地经验
  • 熟悉分布式训练框架:DeepSpeed、Megatron-LM、FSDP、Ray
  • 有 Agent / 工具调用 / 多步推理 的 RL 训练经验
  • 在 NeurIPS、ICML、ICLR 等顶会发表过论文
  • 有强化学习开源社区相关贡献者优先

福利待遇

  • 参与前沿技术研发,接触国产芯片生态
  • 有机会在顶级会议发表论文
  • 开源社区贡献认可与成长机会
  • 项目落地经验积累,推动技术商业化