返回岗位列表

面壁智能

算法研究与开发工程师

地点:成都 薪资:薪资未公开 日期:2026-01-29

岗位摘要

算法研究与开发;深入研究强化学习领域的前沿算法(如PPO、GRPO等)并应用于大模型领域;优化强化学习训练框架,提升训练速度与稳定性;大规模应用强化学习,以提升模型的长思考能力、通用能力、Agent能力等

岗位职责

  • 算法研究与开发
  • 深入研究强化学习领域的前沿算法(如PPO、GRPO等)并应用于大模型领域
  • 优化强化学习训练框架,提升训练速度与稳定性
  • 大规模应用强化学习,以提升模型的长思考能力、通用能力、Agent能力等

任职要求

  • 计算机科学、人工智能、机器学习、数学、统计学或相关领域的硕士及以上学历
  • 熟练掌握强化学习经典算法(如PPO、GRPO等),并具备实际项目经验
  • 紧跟学术前沿,积极探索前沿算法,针对实际项目中的问题优化算法
  • 熟悉深度学习框架(如TensorFlow、PyTorch)和强化学习训练框架(如verl、openrlhf、trl、nemo-aligner等)
  • 了解大规模分布式模型训练(如deepspeed、FSDP、megatron等)
  • 具备扎实的编程能力,熟练使用Python,熟悉常用数据结构和算法
  • 具备较强的学习能力和解决问题的能力,能够快速学习新技术,基础扎实,动手能力强

加分项

  • 在顶级会议(如NeurIPS、ICLR、ACL、EMNLP、NAACL等)发表过强化学习相关论文,有ACM、NOI等编程竞赛经验