返回岗位列表

DeepSeek

大模型后训练算法工程师

地点:北京 薪资:薪资未公开 日期:2026-06-27

岗位摘要

持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力;跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent等核心场景的表现

岗位职责

  • 持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力
  • 跨部门团队紧密协作,构建高质量、高多样性的后训练数据集
  • 设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent等核心场景的表现
  • 建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与Agent场景,精准定位模型短板并驱动针对性优化

任职要求

  • 对大模型后训练有深入理解,熟悉RLHF/RLVR/PPO/GRPO等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验
  • 具备扎实的数据直觉与工程能力,能够从复杂、多源的数据中提炼信号,并将数据清洗、筛选与合成流程系统化、自动化
  • 对模型评测有方法论层面的思考,不满足于刷benchmark,而是能设计出真正反映模型能力边界与短板的评测方案

福利待遇

  • 实习或全职岗位,灵活选择
  • 参与前沿AI模型研发,与顶尖团队合作
  • 推动技术落地,直接贡献于产品核心能力