可解释性研究员/工程师
岗位摘要
加入Anthropic的可解释性团队,致力于逆向工程已训练模型的工作机制;专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法;构建用于研究神经网络的“显微镜”工具,或将其视为需要“逆向工程”的二进制计算机程序
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 加入Anthropic的可解释性团队,致力于逆向工程已训练模型的工作机制
- 专注于机械可解释性研究,旨在发现神经网络参数如何映射到有意义的算法
- 构建用于研究神经网络的“显微镜”工具,或将其视为需要“逆向工程”的二进制计算机程序
- 为机械性地理解神经网络并确保其安全建立坚实的基础
- 短期重点解决“叠加”问题,该问题导致模型的神经元和注意力头等计算单元难以单独解释
- 寻找将模型分解为更易解释组件的方法
任职要求
- 对现代语言模型的工作原理及其可信度抱有好奇心和研究热情
- 致力于通过机制性理解来确保先进AI系统的安全
- 具备研究或工程背景,能够为团队目标做出贡献
- 对机械可解释性领域有浓厚兴趣,并愿意深入了解相关概念(如叠加、分解)
- 能够理解并借鉴团队过往的研究成果和出版物
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。