研究工程师(模型评估团队)
岗位摘要
设计新颖的评估方法,以评估模型在推理、安全性、有用性和无害性等不同领域的能力;领导Anthropic评估平台的设计和架构,确保其能够随着我们快速发展的模型能力和研究需求而扩展;实施和维护在生产训练期间运行的高吞吐量评估管道,提供实时洞察以指导训练决策
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计新颖的评估方法,以评估模型在推理、安全性、有用性和无害性等不同领域的能力
- 领导Anthropic评估平台的设计和架构,确保其能够随着我们快速发展的模型能力和研究需求而扩展
- 实施和维护在生产训练期间运行的高吞吐量评估管道,提供实时洞察以指导训练决策
- 分析评估结果以识别模式、故障模式和模型改进机会,将复杂发现转化为可操作的见解
- 与研究团队合作,开发特定领域的评估,以探测新兴能力和潜在风险
- 构建基础设施,以支持评估设计的快速迭代,支持自动化和人在环路的评估方法
- 在整个组织内建立评估开发的最佳实践和标准
- 指导团队成员,并为Anthropic评估专业知识的增长做出贡献
- 在关键训练运行期间协调评估工作,确保全面覆盖和及时的结果
- 为关于评估方法和发现的研究出版物和外部交流做出贡献
任职要求
- 拥有设计和实施机器学习模型(特别是大型语言模型)评估系统的经验
- 拥有技术领导经验(正式或通过领导复杂技术项目)
- 擅长系统工程和实验设计,能够在构建基础设施的同时保持科学严谨性
- 拥有Python编程技能和分布式计算框架经验
- 能够在研究需求和工程约束之间进行转换,为复杂问题找到务实的解决方案
- 以结果为导向,在优先级可能根据研究发现而变化的快节奏环境中茁壮成长
- 喜欢协作工作,并能有效地向不同的利益相关者传达技术概念
- 深切关注AI安全以及我们所构建系统的社会影响
- 拥有统计分析经验,并能从大规模实验数据中得出有意义的结论
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。