返回岗位列表

昆仑万维

强化学习算法工程师(校招)

地点:北京 薪资:30-50K 日期:2026-03-03

岗位摘要

开展强化学习在大模型上的探索工作,通过前沿研究和技术创新优化RL训练Pipeline,提高模型的复杂推理和通用指令跟随能力;开展强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)上的落地探索,拓宽大模型的应用边界

岗位职责

  • 开展强化学习在大模型上的探索工作,通过前沿研究和技术创新优化RL训练Pipeline,提高模型的复杂推理和通用指令跟随能力
  • 开展强化学习在复杂Agent任务(如Computer Use、Deep Research、AI IDE等)上的落地探索,拓宽大模型的应用边界
  • 跟进学术前沿,鼓励将研究工作开源,并撰写论文或技术报告,促进团队内部及外部的技术交流

任职要求

  • 跟进RLHF/RFT主流研究方向,熟悉RLHF的Pipeline,了解DPO/PPO/GRPO等常见算法的细节与差异,对reasoning model的最新进展有跟进
  • 有相关训练算法训练与优化经验者优先考虑
  • 具备扎实的机器学习、深度学习、强化学习基础,能对训练中的现象进行合理分析,客观给出结论,并针对训练问题提出合理的新思路
  • 熟悉大模型和RLHF的常见训练框架,如Deepspeed、Megatron、Verl、Openrlhf等主流框架
  • 编程功底扎实,能快速且正确实现自己的实验需求

福利待遇

  • 月薪30-50K,13薪
  • 参与前沿大模型强化学习研究与技术创新
  • 研究成果开源及论文发表机会
  • 良好的技术交流与成长环境

工作地址

北京东城区明阳国际中心111