强化学习算法工程师(校招)
岗位摘要
开展强化学习在大模型上的探索工作,通过前沿研究和技术创新优化RL训练Pipeline,提高模型的复杂推理和通用指令跟随能力;开展强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)上的落地探索,拓宽大模型的应用边界
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 开展强化学习在大模型上的探索工作,通过前沿研究和技术创新优化RL训练Pipeline,提高模型的复杂推理和通用指令跟随能力
- 开展强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)上的落地探索,拓宽大模型的应用边界
- 跟进学术前沿,鼓励将研究工作开源,并撰写论文或技术报告,促进团队内部及外部的技术交流
任职要求
- 跟进RLHF/RFT主流研究方向,熟悉RLHF的Pipeline,了解DPO/PPO/GRPO等常见算法的细节与差异,对reasoning model的最新进展有跟进
- 有相关训练算法训练与优化经验者优先考虑
- 具备扎实的机器学习、深度学习、强化学习基础,能对训练中的现象进行合理分析,客观给出结论,并针对训练问题提出合理的新思路
- 熟悉大模型和RLHF的常见训练框架,如Deepspeed、Megatron、Verl、Openrlhf等主流框架
- 编程功底扎实,能快速且正确实现自己的实验需求
福利待遇
- 月薪30-50K,13薪
- 参与前沿大模型强化学习研究与技术创新
- 研究成果开源及论文发表机会
- 良好的技术交流与成长环境
工作地址
北京东城区明阳国际中心111
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。