返回岗位列表

Anthropic

研究工程师,强化学习扩展科学

地点:英国 薪资:£375,000-£640,000 GBP 日期:2026-09-18

岗位摘要

设计、运行并解释大规模强化学习实验,严谨推理数据能说明和不能说明的内容;研究强化学习在任务时长、算力和模型规模增长时如何改进;构建并维护长时程强化学习基准,使进展可衡量且可复现;将验证后的发现转化为生产训练配方,并判断结果何时足够稳健可上线

岗位职责

  • 设计、运行并解释大规模强化学习实验,严谨推理数据能说明和不能说明的内容
  • 研究强化学习在任务时长、算力和模型规模增长时如何改进
  • 构建并维护长时程强化学习基准,使进展可衡量且可复现
  • 将验证后的发现转化为生产训练配方,并判断结果何时足够稳健可上线
  • 调试研究遇到基础设施交汇处的复杂问题,尤其是仅在规模化时出现的故障
  • 与研究和工程领域的相邻强化学习团队紧密合作,推进整体强化学习技术栈

任职要求

  • 在强化学习、大规模机器学习训练或密切相关领域具备扎实的实证研究能力
  • 证明有能力端到端负责大型实验,从设计到解释
  • 精通Python,并有大规模或分布式机器学习系统经验
  • 适应研究与系统交界处的工作,包括调试两者交汇处的问题
  • 关心人工智能的社会影响和负责任扩展
  • 在长时程强化学习或强化学习基础方面有发表或交付成果
  • 有将研究发现转化为生产训练配方的经验
  • 通过强化学习干预展现出大规模产业影响力
  • 有在前沿规模、长轨迹训练运行中工作的经验