人工智能控制与监控研究科学家
岗位摘要
设计方法、系统和实验,确保高级AI模型和智能体在高风险或对抗性环境中保持与预期目标一致;开发实时监控技术和可观测性方法,跟踪AI行为,识别并标记偏差、涌现能力或异常输出;研究分层控制机制,包括故障安全、监督协议和干预方法,在检测到风险时暂停或重定向AI系统
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计方法、系统和实验,确保高级AI模型和智能体在高风险或对抗性环境中保持与预期目标一致
- 开发实时监控技术和可观测性方法,跟踪AI行为,识别并标记偏差、涌现能力或异常输出
- 研究分层控制机制,包括故障安全、监督协议和干预方法,在检测到风险时暂停或重定向AI系统
- 设计红队模拟,探测监督和控制机制的弱点,并构建缓解措施以弥补发现的漏洞
- 与政策制定者、工程师和其他研究人员合作,建立AI监控和升级的标准与基准
任职要求
- 致力于推动安全、可靠和可信的AI部署,随着前沿AI能力的持续进步
- 具备协作进行技术研究的实践经验,能够设计AI系统的控制和监控实验,构建原型系统,并快速将研究文献中的新想法转化为工作原型
- 在机器学习领域有已发表的研究成果,特别是在生成式AI方面
- 至少三年处理复杂机器学习问题的经验,无论是在研究环境还是产品开发中
- 具备出色的书面和口头沟通能力,能够在跨职能团队中工作
- 加分项:具备运行时监控、异常检测或ML系统可观测性经验
- 加分项:熟悉AI控制或对齐研究(如可扩展监督、可解释性、辩论)
- 加分项:具备后训练和强化学习技术经验,如RLHF、DPO、GRPO等
福利待遇
- 具有竞争力的薪资,包括基本工资、股权和福利
- 股权补偿,需经董事会批准
- 具体薪资范围根据工作地点、技能、经验、面试表现等因素在面试过程中确定
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。