返回岗位列表

Google DeepMind

研究科学家/工程师 - 后训练前沿模型

地点:瑞士 薪资:薪资未公开 日期:2026-01-22

岗位摘要

前沿方法开发:为无‘教师’模型的前沿模型设计和验证新颖的后训练流程(如SFT、RLHF、RLAIF);推进奖励建模:领导下一代奖励模型的研究,包括探索新架构、减少奖励攻击以及提升偏好数据中的信噪比

岗位职责

  • 前沿方法开发:为无‘教师’模型的前沿模型设计和验证新颖的后训练流程(如SFT、RLHF、RLAIF)
  • 推进奖励建模:领导下一代奖励模型的研究,包括探索新架构、减少奖励攻击以及提升偏好数据中的信噪比
  • 解锁‘思考’能力:创新方法以改进模型的内部推理(思维链),专注于多步骤任务中的正确性、逻辑性和自我纠正
  • 革新强化学习范式:批判性地重新评估和优化强化学习提示与反馈机制,以从基础模型中提取最大性能
  • 解决‘飞轮’挑战:创建稳健的机制,将用户信号和互动转化为训练数据,使模型持续改进而不引入回归或偏见
  • 横向影响:跨团队协作,将这些先进方法应用于不同模型规模和模态(如音频),确保一致的高质量行为

任职要求

  • 拥有机器学习、人工智能或计算机科学博士学位(或具备同等实践经验)
  • 在大型语言模型、强化学习或偏好学习方面有深厚背景
  • 对将人工智能系统与人类反馈和效用对齐有研究兴趣
  • 熟悉实验设计和大规模用户数据分析
  • 具备强化学习人类反馈或直接偏好优化经验者优先
  • 具备构建或改进奖励模型经验者优先