返回岗位列表

Anthropic

研究工程师(AI安全评估)

地点:远程 薪资:$320,000-$405,000 日期:2026-01-29

岗位摘要

设计和运行实验以提高评估质量,包括开发生成代表性测试数据、模拟真实用户行为和验证评分准确性的方法;研究不同因素(多轮对话、工具、长上下文、用户多样性)如何影响模型的安全行为;分析评估覆盖范围,以识别差距并确定需要改进测量的领域

岗位职责

  • 设计和运行实验以提高评估质量,包括开发生成代表性测试数据、模拟真实用户行为和验证评分准确性的方法
  • 研究不同因素(多轮对话、工具、长上下文、用户多样性)如何影响模型的安全行为
  • 分析评估覆盖范围,以识别差距并确定需要改进测量的领域
  • 将成功的研究成果产品化,集成到在模型训练、发布及之后运行的评估流水线中
  • 与政策和执行团队合作,将现实世界的危害模式转化为可衡量的评估
  • 构建工具,使政策专家能够创建和迭代评估
  • 向研究和训练团队展示发现,以推动上游模型改进

任职要求

  • 拥有4年以上软件工程或机器学习工程经验
  • 精通Python,并能熟练处理全栈工作
  • 熟悉数据分析,并能从大型数据集中提取见解
  • 有大型语言模型(LLM)经验,了解其能力和失败模式
  • 能够在原型设计和生产级代码之间流畅切换
  • 对模糊问题感到兴奋,并能将其转化为具体的实验
  • 深切关注AI安全,并希望自己的工作产生实际影响