返回岗位列表

阿里巴巴

大模型后训练算法工程师

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

探索更多可扩展的验证器信号,并通过强化学习提升模型的各项能力;提升奖励模型在创作、人类偏好、指令遵循等各专项上的能力,减少奖励作弊和偏差;研究推理路径压缩和外推,实现更高质量的推理思考

岗位职责

  • 探索更多可扩展的验证器信号,并通过强化学习提升模型的各项能力
  • 提升奖励模型在创作、人类偏好、指令遵循等各专项上的能力,减少奖励作弊和偏差
  • 研究推理路径压缩和外推,实现更高质量的推理思考
  • 将大语言模型的推理能力和智能体以及其他模态相结合,探索统一模态的推理

任职要求

  • 计算机、机器学习等方向相关专业,博士及硕士优先
  • 具有后训练或强化学习相关方向经验
  • 精通Python以及PyTorch等深度学习框架,具有较强的代码工程能力
  • 熟悉大语言模型推理引擎(如vLLM、SGLang)的实现者优先
  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于NeurIPS、ICLR、ICML、ACL等者优先
  • 拥有知名开源项目,在开源社区具有较好影响力者优先

加分项

  • 熟悉LLM推理引擎(如vLLM,SGLang)的实现
  • 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于NeurIPS、ICLR、ICML、ACL等
  • 拥有知名开源项目,在开源社区具有较好的影响力