机器学习基础设施软件工程师
岗位摘要
设计和维护容错、高性价比的系统,用于管理跨集群和云的计算资源分配、调度和自动扩缩容;构建统一的抽象层和API,以整合服务与训练工作负载的作业提交、遥测和可观测性;开发使用计量、成本归因和配额管理系统,以实现计算预算的透明度和控制
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和维护容错、高性价比的系统,用于管理跨集群和云的计算资源分配、调度和自动扩缩容
- 构建统一的抽象层和API,以整合服务与训练工作负载的作业提交、遥测和可观测性
- 开发使用计量、成本归因和配额管理系统,以实现计算预算的透明度和控制
- 通过改进调度、装箱、抢占和资源共享,提高大规模GPU工作负载的可靠性和效率
- 与机器学习工程师和API团队合作,识别瓶颈并定义长期架构标准
- 在跨职能环境中,领导项目从需求收集、设计到部署和监控的端到端实施
任职要求
- 拥有4年以上构建大规模后端或分布式系统的经验
- 熟练掌握Python、Go或Rust编程,并熟悉现代云原生架构
- 具备容器和编排工具(Kubernetes、Docker)以及基础设施即代码(Terraform)的经验
- 熟悉调度器或工作负载管理系统(例如,Kubernetes控制器、Slurm、Ray、内部作业队列)
- 理解可观测性和可靠性实践(指标、追踪、告警、SLO)
- 拥有在生产环境中提升系统效率、可靠性或开发速度的良好记录
福利待遇
- 全面的健康、牙科和视力保险
- 学习和发展津贴
- 丰厚的带薪休假
- 可能符合通勤津贴等额外福利的资格
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。