返回岗位列表

Anthropic

研究工程师(对齐科学)

地点:远程 薪资:$350,000-$500,000 日期:2026-01-29

岗位摘要

构建并运行优雅且严谨的机器学习实验,以帮助理解和引导强大AI系统的行为;专注于使AI变得有益、诚实和无害,并关注在人类水平能力背景下可能面临的挑战;作为对齐科学团队的研究工程师,为AI安全的探索性实验研究做出贡献

岗位职责

  • 构建并运行优雅且严谨的机器学习实验,以帮助理解和引导强大AI系统的行为
  • 专注于使AI变得有益、诚实和无害,并关注在人类水平能力背景下可能面临的挑战
  • 作为对齐科学团队的研究工程师,为AI安全的探索性实验研究做出贡献
  • 重点关注来自未来强大系统(如根据负责任扩展政策被指定为ASL-3或ASL-4的系统)的风险
  • 与可解释性、微调和前沿红队等其他团队合作进行研究
  • 参与当前重点研究领域,包括可扩展监督、AI控制、对齐压力测试、自动化对齐研究、对齐评估和保障措施研究

任职要求

  • 具备科学家和工程师的双重特质
  • 关心如何使AI变得有益、诚实和无害
  • 对在人类水平能力背景下实现AI安全的挑战感兴趣
  • 能够与跨职能团队协作