强化学习算法工程师
岗位摘要
开展强化学习算法研究与开发工作;深入研究PPO、GRPO等前沿强化学习算法并应用于大模型领域;优化强化学习训练框架,提升训练速度与稳定性;大规模应用强化学习技术,提升模型的长思考能力、通用能力和Agent能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 开展强化学习算法研究与开发工作
- 深入研究PPO、GRPO等前沿强化学习算法并应用于大模型领域
- 优化强化学习训练框架,提升训练速度与稳定性
- 大规模应用强化学习技术,提升模型的长思考能力、通用能力和Agent能力
任职要求
- 计算机科学、人工智能、机器学习、数学、统计学或相关领域硕士及以上学历
- 熟练掌握PPO、GRPO等强化学习经典算法,具备实际项目经验
- 紧跟学术前沿,积极探索前沿算法,针对实际问题优化算法
- 熟悉TensorFlow、PyTorch等深度学习框架,以及verl、openrlhf、trl、nemo-aligner等强化学习训练框架
- 了解deepspeed、FSDP、megatron等大规模分布式模型训练技术
- 具备扎实的编程能力,熟练使用Python,熟悉常用数据结构和算法
- 具备较强的学习能力和解决问题的能力,能够快速学习新技术,基础扎实,动手能力强
- 加分项:在NeurIPS、ICLR、ACL、EMNLP、NAACL等顶级会议发表过强化学习相关论文,或有ACM、NOI等编程竞赛经验
加分项
- 在顶级会议(如NeurIPS、ICLR、ACL、EMNLP、NAACL等)发表过强化学习相关论文,有ACM、NOI等编程竞赛经验
- 赵楠 刚刚活跃
工作地址
深圳南山区民企科技园南山区桃源街道丽山路65号平山民企科技园3栋3层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。