研究工程师,强化学习扩展科学
岗位摘要
设计、运行并解释大规模强化学习实验,严谨推理数据能说明和不能说明的内容;研究强化学习在任务时长、算力和模型规模增长时如何改进;构建并维护长时程强化学习基准,使进展可衡量且可复现;将验证后的发现转化为生产训练配方,并判断结果何时足够稳健可上线
岗位职责
- 设计、运行并解释大规模强化学习实验,严谨推理数据能说明和不能说明的内容
- 研究强化学习在任务时长、算力和模型规模增长时如何改进
- 构建并维护长时程强化学习基准,使进展可衡量且可复现
- 将验证后的发现转化为生产训练配方,并判断结果何时足够稳健可上线
- 调试研究遇到基础设施交汇处的复杂问题,尤其是仅在规模化时出现的故障
- 与研究和工程领域的相邻强化学习团队紧密合作,推进整体强化学习技术栈
任职要求
- 在强化学习、大规模机器学习训练或密切相关领域具备扎实的实证研究能力
- 证明有能力端到端负责大型实验,从设计到解释
- 精通Python,并有大规模或分布式机器学习系统经验
- 适应研究与系统交界处的工作,包括调试两者交汇处的问题
- 关心人工智能的社会影响和负责任扩展
- 在长时程强化学习或强化学习基础方面有发表或交付成果
- 有将研究发现转化为生产训练配方的经验
- 通过强化学习干预展现出大规模产业影响力
- 有在前沿规模、长轨迹训练运行中工作的经验