返回岗位列表

Anthropic

奖励模型工程师

地点:远程 薪资:$350,000-$500,000 日期:2026-01-29

岗位摘要

负责奖励模型训练的端到端工程,从数据摄取到模型评估和部署;设计和实施高效、可靠的训练管道,能够扩展到越来越大的模型规模;构建稳健的数据管道,用于收集、处理人类反馈并将其纳入奖励模型训练

岗位职责

  • 负责奖励模型训练的端到端工程,从数据摄取到模型评估和部署
  • 设计和实施高效、可靠的训练管道,能够扩展到越来越大的模型规模
  • 构建稳健的数据管道,用于收集、处理人类反馈并将其纳入奖励模型训练
  • 优化分布式系统中的训练基础设施,以提高吞吐量、效率和容错能力
  • 扩展奖励模型能力,以支持新领域和额外的数据模态
  • 与研究人员合作,实施和迭代新颖的奖励建模技术
  • 开发工具和监控系统,以确保训练质量并及早发现问题
  • 参与我们整体模型训练基础设施的设计和改进

任职要求

  • 拥有构建和维护大规模机器学习系统的丰富经验
  • 精通Python,并有使用PyTorch等机器学习框架的经验
  • 具有分布式训练系统经验,并能优化机器学习工作负载以提高效率
  • 能够熟练处理大型数据集并构建大规模数据管道
  • 能够在研究探索与工程严谨性及操作可靠性之间取得平衡
  • 喜欢与研究人员密切合作,并将研究想法转化为可靠的工程系统
  • 以结果为导向,倾向于灵活性和影响力
  • 能够在快速变化的研究环境中应对模糊性并取得进展
  • 能够快速适应不断变化的优先级,同时处理多个紧急问题
  • 在调试复杂、时间敏感的问题时保持清晰
  • 愿意承担额外工作,即使超出职位描述范围
  • 关心工作的社会影响,并受到Anthropic使命的激励