返回岗位列表

OpenAI

对齐科学研究员

地点:美国 薪资:薪资未公开 日期:2026-07-20

岗位摘要

设计和实施专注于意图遵循、诚实性、校准性和鲁棒性的对齐实验;使用强化学习及其他实证机器学习方法训练和评估模型;开发针对幻觉、指令遵循失败、奖励黑客、隐蔽行为和欺骗等失败模式的评估方法;研究鼓励模型验证自身行为并诚实报告缺陷的方法,包括忏悔式训练目标

岗位职责

  • 设计和实施专注于意图遵循、诚实性、校准性和鲁棒性的对齐实验
  • 使用强化学习及其他实证机器学习方法训练和评估模型
  • 开发针对幻觉、指令遵循失败、奖励黑客、隐蔽行为和欺骗等失败模式的评估方法
  • 研究鼓励模型验证自身行为并诚实报告缺陷的方法,包括忏悔式训练目标
  • 构建监控和推理时干预措施,确保合规行为或向用户或下游系统揭示模型问题
  • 研究对齐方法如何随模型能力、计算量、数据、上下文长度、行动长度和对抗压力扩展
  • 将成功的技术整合到模型训练和部署工作流程中
  • 在研究成果推动对齐科学进步时,产出可公开发表的研究论文
  • 与后训练、强化学习、评估、安全和产品团队的研究人员和工程师合作

任职要求

  • 具备训练、评估或调试大型机器学习模型(尤其是大语言模型)的丰富实践经验
  • 精通Python及现代机器学习框架(如PyTorch)
  • 具备数学严谨性、定量分析能力,并能将模糊的研究问题转化为可衡量的实验
  • 拥有强化学习、后训练、偏好优化、可扩展监督、模型评估或相关实证机器学习研究经验
  • 能够高度独立工作,无需日常密切指导
  • 适应快节奏、协作式的研究环境,能随模型和证据变化灵活调整优先级
  • 在技术问题解决方面有出色记录,如竞赛编程、数学竞赛、系统工作或类似的严谨工程和研究项目
  • 关注构建可信、诚实且可靠的高风险AI系统

福利待遇

  • 混合工作模式(每周3天在办公室)
  • 为新员工提供搬迁援助
  • 对优秀的远程候选人开放
  • 参与前沿AI对齐研究
  • 与顶尖研究团队合作