返回岗位列表

Anthropic

可解释性研究员/工程师

地点:美国 薪资:$315,000-$560,000 日期:2026-01-29

岗位摘要

加入Anthropic的可解释性团队,致力于逆向工程已训练模型的工作机制;专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法;构建用于研究神经网络的“显微镜”工具,或将其视为需要“逆向工程”的二进制计算机程序

岗位职责

  • 加入Anthropic的可解释性团队,致力于逆向工程已训练模型的工作机制
  • 专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法
  • 构建用于研究神经网络的“显微镜”工具,或将其视为需要“逆向工程”的二进制计算机程序
  • 为机械性地理解神经网络并确保其安全建立坚实的基础
  • 短期重点解决“叠加”问题,该问题导致模型的神经元和注意力头等计算单元难以单独解释
  • 寻找将模型分解为更易解释组件的方法

任职要求

  • 对现代语言模型的工作原理及其可信度抱有好奇心和研究热情
  • 致力于通过机制性理解来确保先进AI系统的安全
  • 具备研究或工程背景,能够为团队目标做出贡献
  • 对机械可解释性领域有浓厚兴趣,并愿意深入了解相关概念(如叠加、分解)
  • 能够理解并借鉴团队过往的研究成果和出版物