软件工程师,强化学习训练基础设施
岗位摘要
通过介入最紧急的工程和基础设施问题,保持大规模强化学习训练运行顺利进行;调试训练系统、推理、编排、扩展和分布式基础设施中的问题;解决研究与工程交叉领域的硬技术问题:扩展实验、提高训练可靠性、调试分布式系统、降低延迟和成本,并使新功能在实际工作负载下稳健运行
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 通过介入最紧急的工程和基础设施问题,保持大规模强化学习训练运行顺利进行
- 调试训练系统、推理、编排、扩展和分布式基础设施中的问题
- 解决研究与工程交叉领域的硬技术问题:扩展实验、提高训练可靠性、调试分布式系统、降低延迟和成本,并使新功能在实际工作负载下稳健运行
- 提高强化学习训练运行的可靠性和效率
- 帮助开发基础设施密集型集成的研究人员,例如多智能体能力或记忆
- 将重复出现的运营问题转化为更好的工具、系统、流程或抽象
- 在紧张的模型运行时间线上与研究、基础设施和合作伙伴团队紧密合作
- 在混乱、模糊的领域中快速发挥作用,其中所有权比完美范围的项目更重要
- 调试跨越模型行为、训练数据、强化学习系统、评估基础设施、服务系统和智能体框架的故障,然后将这些故障转化为假设、修复和持久改进
任职要求
- 希望训练和交付我们的前沿模型,并确保我们为开发者、企业、研究人员和日常用户真正提供有用的智能体
- 是一名强大的通才工程师,在机器学习基础设施的某些层面有经验
- 曾从事强化学习、推理、扩展、训练系统、编排或相关机器学习基础设施工作
- 学习速度极快,并且能够自如地在不熟悉的层面操作
- 是一名强大的调试者,具有高度的主人翁意识、低自我和出色的沟通能力
- 能够在时间紧迫的混乱领域中落地,快速发挥作用,并逐步提高整个系统的质量
- 在可靠性、速度和判断力至关重要的快节奏环境中充满活力
- 喜欢在团队需要时构建承载系统和流程,即使工作并不光鲜
- 有支持大规模模型训练、异步强化学习系统或高吞吐量机器学习基础设施的经验者优先
- 有跨GPU、网络、编排或推理栈调试分布式系统的经验者优先
- 有性能优化、扩展或生产关键基础设施背景者优先
- 有直接与研究人员或快速移动的模型团队合作经验者优先
福利待遇
- 参与训练和交付前沿AI模型的机会
- 与顶尖研究和工程团队合作
- 解决高影响力、技术挑战性问题
- 快节奏、创新驱动的环境
- 推动通用人工智能造福全人类的使命
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。