返回岗位列表

Anthropic

研究工程师/科学家(可解释性团队)

地点:远程 薪资:$350,000-$500,000 日期:2026-01-29

岗位摘要

专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法;致力于为机械理解神经网络并确保其安全建立坚实的科学基础;解决导致模型计算单元(如神经元和注意力头)难以解释的“叠加”问题

岗位职责

  • 专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法
  • 致力于为机械理解神经网络并确保其安全建立坚实的科学基础
  • 解决导致模型计算单元(如神经元和注意力头)难以解释的“叠加”问题
  • 寻找方法将模型分解为更具可解释性的组件
  • 开发使用特征构建电路的方法,并利用这些电路理解模型计算相关的机制
  • 研究具体案例,如多跳推理、规划和思维链忠实度

任职要求

  • 对可解释性研究充满热情
  • 愿意担任个人贡献者角色