返回岗位列表

Anthropic

研究工程师(对齐科学)

地点:远程 薪资:£260,000-£370,000 日期:2026-01-29

岗位摘要

构建并运行优雅且严谨的机器学习实验,以帮助理解和引导强大AI系统的行为;专注于使AI变得有益、诚实和无害,并关注在人类水平能力背景下可能面临的挑战;作为对齐科学团队的研究工程师,为AI安全的探索性实验研究做出贡献

岗位职责

  • 构建并运行优雅且严谨的机器学习实验,以帮助理解和引导强大AI系统的行为
  • 专注于使AI变得有益、诚实和无害,并关注在人类水平能力背景下可能面临的挑战
  • 作为对齐科学团队的研究工程师,为AI安全的探索性实验研究做出贡献
  • 重点关注来自未来强大系统(如根据负责任扩展政策被指定为ASL-3或ASL-4的系统)的风险
  • 与可解释性、微调和前沿红队等其他团队合作进行研究
  • 测试安全技术的稳健性,例如训练语言模型来规避安全技术,并评估其规避干预措施的有效性
  • 运行多智能体强化学习实验,以测试AI辩论等技术
  • 构建工具以有效评估新颖的LLM生成的越狱方法的有效性
  • 编写脚本和提示,以高效生成评估问题,测试模型在安全相关背景下的推理能力
  • 为研究论文贡献想法、图表和文字

任职要求

  • 候选人需具备科学家和工程师的双重特质
  • 所有面试均使用Python进行
  • 候选人需常驻伦敦至少25%的时间,并偶尔前往旧金山出差