安全训练研究员(国家安全方向)
岗位摘要
为美国政府用途训练和评估模型,聚焦国家安全应用;研究并实现安全训练、强化学习与对抗鲁棒性方法;开发评估方法,识别模型失效模式,并利用发现改进训练;与研究、工程、安全与政策合作方协作,支持安全可靠的部署
岗位职责
- 为美国政府用途训练和评估模型,聚焦国家安全应用
- 研究并实现安全训练、强化学习与对抗鲁棒性方法
- 开发评估方法,识别模型失效模式,并利用发现改进训练
- 与研究、工程、安全与政策合作方协作,支持安全可靠的部署
任职要求
- 拥有4年以上相关人工智能安全研究经验,包括RLHF、对抗训练或鲁棒性
- 拥有计算机科学、机器学习或相关领域学位,具备扎实的深度学习研究或工程能力
- 具有为部署改进模型安全的经验,并乐于协作研究
- 认同OpenAI使命,并致力于在安全关键场景中负责任地使用人工智能
- 持有有效的TS/SCI安全许可或同等资格