返回岗位列表

OpenAI

研究员,对齐思维链可监控性

地点:美国 薪资:薪资未公开 日期:2026-09-18

岗位摘要

设计并运行针对前沿推理模型及训练设置的思维链可监控性实证研究;构建评估,衡量监控器能否可靠预测关注属性,包括高风险不当行为;研究预训练、合成数据、中期训练、后训练、强化学习及其他干预如何提升或降低可监控性

岗位职责

  • 设计并运行针对前沿推理模型及训练设置的思维链可监控性实证研究
  • 构建评估,衡量监控器能否可靠预测关注属性,包括高风险不当行为
  • 研究预训练、合成数据、中期训练、后训练、强化学习及其他干预如何提升或降低可监控性
  • 分析模型行为,并将监控观察转化为假设、实验和建议
  • 将研究发现转化为可指导真实训练运行的实用监控与监督方法
  • 与模型训练、对齐评估、监控和前沿风险领域的研究人员及工程师合作
  • 当结果推进更广泛对齐科学时,产出可对外发表的研究

任职要求

  • 具备训练、评估或调试大型机器学习模型(尤其是大语言模型)的扎实实践经验
  • 具有强烈好奇心、对对齐的兴趣和高主动性
  • 在对齐、可解释性、模型行为、实证机器学习或相关研究方面有深度
  • 有志于研究思维链可监控性、监控方法和可扩展监督
  • 能将模糊研究问题转化为可衡量实验,并在结果细微或不确定时遵循证据
  • 欢迎直接具备思维链可解释性经验,但非必需;优秀候选人可来自更广泛的可解释性、对齐、模型训练或调查性模型行为工作

福利待遇

  • 采用混合办公模式,每周到办公室3天
  • 为新员工提供搬迁援助
  • 有机会参与前沿对齐研究并产出可对外发表成果