研究科学家,安全后训练
岗位摘要
设计和运行后训练流程,研究训练选择如何影响模型的安全性、鲁棒性和对齐属性;开发基于可解释性的评估方法,揭示模型产生不安全、欺骗性或其他不良行为的原因和方式,并利用这些见解指导针对性的缓解措施
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和运行后训练流程,研究训练选择如何影响模型的安全性、鲁棒性和对齐属性
- 开发基于可解释性的评估方法,揭示模型产生不安全、欺骗性或其他不良行为的原因和方式,并利用这些见解指导针对性的缓解措施
- 与政策制定者、工程师和其他研究人员合作,将后训练和可解释性发现转化为可操作的安全标准、评估基准和最佳实践
任职要求
- 致力于推动行业安全、可靠和可信赖的AI部署,随着前沿AI能力的持续进步
- 具备后训练和强化学习技术(如RLHF、DPO、GRPO等)的经验
- 在机器学习领域,特别是生成式AI方面有已发表的研究成果
- 至少三年处理复杂机器学习问题的经验,无论是在研究环境还是产品开发中
- 具备出色的书面和口头沟通能力,能够在跨职能团队中工作
- 优先考虑:具备机械可解释性、探针或其他理解模型内部机制技术的经验
- 优先考虑:熟悉后训练模型的红队测试或对抗性评估
- 优先考虑:研究后训练引入或掩盖的失败模式,如奖励黑客、谄媚或对齐伪装
福利待遇
- 全面的健康、牙科和视力保险
- 学习和发展津贴
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。