返回岗位列表

智谱AI

强化学习算法专家

地点:北京 薪资:30-60K 日期:2026-03-03

岗位摘要

负责LLM强化学习用于大模型智能体GUI/API Agent的模型整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果;强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向

岗位职责

  • 负责LLM强化学习用于大模型智能体GUI/API Agent的模型整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果
  • 强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向
  • 改进和完善大语言模型的强化学习的分布式工程框架,实现更高效的模型训练

任职要求

  • 扎实的算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情
  • 具备RL算法优化和工程项目实践经验,在ICML、NeurIPS、ICLR、JMLR、ACL、KDD等顶级会议或期刊上发表过论文,或在RL应用相关的大型比赛中获得名次
  • 了解Agent相关的前沿进展,并对于将强化学习应用在LLM Agent训练中感兴趣;有大语言模型算法优化和大规模分布式RL框架优化经验优先
  • 良好的沟通能力和跨团队协作能力,能够梳理繁杂的工作并建立有效机制,推动上下游配合完成目标

福利待遇

  • 能专注LLM底层算法和工程研发,利用强化学习与LLM解决大模型能力提升中的有实际价值的难题
  • 加入一个专注技术研发的人工智能模型的团队,与各个方向的算法专家交流学习

工作地址

北京海淀区搜狐网络大厦11层