对齐科学研究员
岗位摘要
设计和实施专注于意图遵循、诚实性、校准性和鲁棒性的对齐实验;使用强化学习及其他实证机器学习方法训练和评估模型;开发针对幻觉、指令遵循失败、奖励黑客、隐蔽行为和欺骗等失败模式的评估方法;研究鼓励模型验证自身行为并诚实报告缺陷的方法,包括忏悔式训练目标
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施专注于意图遵循、诚实性、校准性和鲁棒性的对齐实验
- 使用强化学习及其他实证机器学习方法训练和评估模型
- 开发针对幻觉、指令遵循失败、奖励黑客、隐蔽行为和欺骗等失败模式的评估方法
- 研究鼓励模型验证自身行为并诚实报告缺陷的方法,包括忏悔式训练目标
- 构建监控和推理时干预措施,确保合规行为或向用户或下游系统揭示模型问题
- 研究对齐方法如何随模型能力、计算量、数据、上下文长度、行动长度和对抗压力扩展
- 将成功的技术整合到模型训练和部署工作流程中
- 在研究成果推动对齐科学进步时,产出可公开发表的研究论文
- 与后训练、强化学习、评估、安全和产品团队的研究人员和工程师合作
任职要求
- 具备训练、评估或调试大型机器学习模型(尤其是大语言模型)的丰富实践经验
- 精通Python及现代机器学习框架(如PyTorch)
- 具备数学严谨性、定量分析能力,并能将模糊的研究问题转化为可衡量的实验
- 拥有强化学习、后训练、偏好优化、可扩展监督、模型评估或相关实证机器学习研究经验
- 能够高度独立工作,无需日常密切指导
- 适应快节奏、协作式的研究环境,能随模型和证据变化灵活调整优先级
- 在技术问题解决方面有出色记录,如竞赛编程、数学竞赛、系统工作或类似的严谨工程和研究项目
- 关注构建可信、诚实且可靠的高风险AI系统
福利待遇
- 混合工作模式(每周3天在办公室)
- 为新员工提供搬迁援助
- 对优秀的远程候选人开放
- 参与前沿AI对齐研究
- 与顶尖研究团队合作
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。