返回岗位列表

昆仑万维

强化学习研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

开展强化学习在大模型上的探索工作,优化RL训练Pipeline,提升模型的复杂推理和指令跟随能力;探索强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)中的应用,拓宽大模型边界

岗位职责

  • 开展强化学习在大模型上的探索工作,优化RL训练Pipeline,提升模型的复杂推理和指令跟随能力
  • 探索强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)中的应用,拓宽大模型边界
  • 跟进学术前沿,推动研究工作开源,撰写论文或技术报告,促进内外部技术交流

任职要求

  • 熟悉RLHF/RFT主流研究方向,了解RLHF pipeline及DPO/PPO/GRPO等算法的细节与差异
  • 掌握机器学习、深度学习、强化学习基础,能分析训练现象并提出改进思路
  • 熟悉大模型和RLHF训练框架(如Deepspeed、Megatron、Verl、Openrlhf),编程能力扎实

福利待遇

  • 在NeurIPS/ICML/ICLR/CVPR等国际会议发表论文者优先
  • 有ACM-ICPC、NOI/OI参赛经验者优先
  • 有大规模RL落地经验者优先