返回岗位列表

Anthropic

机器学习工程师/研究工程师 - 安全防护

地点:远程 薪资:$350,000-$500,000 日期:2026-01-29

岗位摘要

开发大规模检测滥用和异常行为的分类器,包括构建用于训练分类器的合成数据管道以及自动获取代表性评估以进行迭代的方法;构建监控跨多次交互的危害(如协调网络攻击和影响力操作)的系统,并开发跨上下文聚合和分析信号的新方法

岗位职责

  • 开发大规模检测滥用和异常行为的分类器,包括构建用于训练分类器的合成数据管道以及自动获取代表性评估以进行迭代的方法
  • 构建监控跨多次交互的危害(如协调网络攻击和影响力操作)的系统,并开发跨上下文聚合和分析信号的新方法
  • 评估并改进自主代理产品的安全性,包括开发威胁模型和测试自主代理风险的环境,以及开发和部署针对提示注入攻击的缓解措施
  • 开展关于自动化红队测试、对抗性鲁棒性以及其他有助于测试或发现滥用行为的研究

任职要求

  • 拥有4年以上机器学习工程、研究工程或应用研究经验(学术界或工业界均可)
  • 精通Python并具备构建机器学习系统的经验
  • 能够胜任从研究到部署的整个流程,包括探索性实验和生产系统
  • 关注AI系统的滥用风险,并致力于缓解这些风险
  • 具备强大的沟通能力,能够向非技术利益相关者解释复杂的技术概念
  • 具备以下一项或多项经验者优先:语言建模和Transformer、构建分类器/异常检测系统/行为机器学习、对抗性机器学习或红队测试、可解释性或探针、强化学习、高性能大规模机器学习系统
  • 至少拥有相关领域的学士学位或同等经验