返回岗位列表

Scale AI

研究科学家,安全后训练

地点:美国 薪资:$216,000-$270,000 日期:2026-07-20

岗位摘要

设计和运行后训练流程,研究训练选择如何影响模型的安全性、鲁棒性和对齐属性;开发基于可解释性的评估方法,揭示模型产生不安全、欺骗性或其他不良行为的原因和方式,并利用这些见解指导针对性的缓解措施

岗位职责

  • 设计和运行后训练流程,研究训练选择如何影响模型的安全性、鲁棒性和对齐属性
  • 开发基于可解释性的评估方法,揭示模型产生不安全、欺骗性或其他不良行为的原因和方式,并利用这些见解指导针对性的缓解措施
  • 与政策制定者、工程师和其他研究人员合作,将后训练和可解释性发现转化为可操作的安全标准、评估基准和最佳实践

任职要求

  • 致力于推动行业安全、可靠和可信赖的AI部署,随着前沿AI能力的持续进步
  • 具备后训练和强化学习技术(如RLHF、DPO、GRPO等)的经验
  • 在机器学习领域,特别是生成式AI方面有已发表的研究成果
  • 至少三年处理复杂机器学习问题的经验,无论是在研究环境还是产品开发中
  • 具备出色的书面和口头沟通能力,能够在跨职能团队中工作
  • 优先考虑:具备机械可解释性、探针或其他理解模型内部机制技术的经验
  • 优先考虑:熟悉后训练模型的红队测试或对抗性评估
  • 优先考虑:研究后训练引入或掩盖的失败模式,如奖励黑客、谄媚或对齐伪装

福利待遇

  • 全面的健康、牙科和视力保险
  • 学习和发展津贴