机器学习基础设施工程师
岗位摘要
与机器学习研究人员合作,提高训练的吞吐量和可靠性;与OEM厂商、云服务提供商等合作,规划和构建前沿的GPU基础设施;提高计算环境的密度和可扩展性,以支持日益增大的强化学习工作负载;创建软件和系统,自动化构建、监控和运行GPU集群
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与机器学习研究人员合作,提高训练的吞吐量和可靠性
- 与OEM厂商、云服务提供商等合作,规划和构建前沿的GPU基础设施
- 提高计算环境的密度和可扩展性,以支持日益增大的强化学习工作负载
- 创建软件和系统,自动化构建、监控和运行GPU集群
- 构建工作负载调度和数据移动系统,支持Cursor不断增长的训练规模
任职要求
- 在系统和基础设施软件工程方面有扎实背景,特别是Python、Typescript、Rust和Golang
- 有分布式存储和网络基础设施的经验,特别是在Linux系统上,涵盖云和裸机环境
- 接触过大规模系统及其独特挑战,理想情况下涉及数千个节点和大量资源占用
- 在生产环境中使用过基础设施即代码和配置管理,涵盖主机和Kubernetes
加分项
- 使用Infiniband或RoCE操作性接触Nvidia GPU,特别是使用Blackwell和Hopper级硬件
- 接触雷、斯卢姆或其他常见的计算和运行时间调度器
- 《大会正式记录,第五十八届会议,补编第5号》(A/C.6/61/Rev.1)
- QQ 上传文件
- 链接 在 URL 中
- GitHub 配置文件
- 请写一个简短的注释 关于一个你自豪的项目
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。