强化学习算法专家
岗位摘要
负责LLM强化学习用于大模型智能体GUI/API Agent的模型整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果;强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责LLM强化学习用于大模型智能体GUI/API Agent的模型整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果
- 强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向
- 改进和完善大语言模型的强化学习的分布式工程框架,实现更高效的模型训练
任职要求
- 扎实的算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情
- 具备RL算法优化和工程项目实践经验,在ICML、NeurIPS、ICLR、JMLR、ACL、KDD等顶级会议或期刊上发表过论文,或在RL应用相关的大型比赛中获得名次
- 了解Agent相关的前沿进展,并对于将强化学习应用在LLM Agent训练中感兴趣;有大语言模型算法优化和大规模分布式RL框架优化经验优先
- 良好的沟通能力和跨团队协作能力,能够梳理繁杂的工作并建立有效机制,推动上下游配合完成目标
福利待遇
- 能专注LLM底层算法和工程研发,利用强化学习与LLM解决大模型能力提升中的有实际价值的难题
- 加入一个专注技术研发的人工智能模型的团队,与各个方向的算法专家交流学习
工作地址
北京海淀区搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。