返回岗位列表

Scale AI

机器学习基础设施软件工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计和维护容错、高性价比的系统,用于管理跨集群和云的计算资源分配、调度和自动扩缩容;构建统一的抽象层和API,以整合服务与训练工作负载的作业提交、遥测和可观测性;开发使用计量、成本归因和配额管理系统,以实现计算预算的透明度和控制

岗位职责

  • 设计和维护容错、高性价比的系统,用于管理跨集群和云的计算资源分配、调度和自动扩缩容
  • 构建统一的抽象层和API,以整合服务与训练工作负载的作业提交、遥测和可观测性
  • 开发使用计量、成本归因和配额管理系统,以实现计算预算的透明度和控制
  • 通过改进调度、装箱、抢占和资源共享,提高大规模GPU工作负载的可靠性和效率
  • 与机器学习工程师和API团队合作,识别瓶颈并定义长期架构标准
  • 在跨职能环境中,领导项目从需求收集、设计到部署和监控的端到端实施

任职要求

  • 拥有4年以上构建大规模后端或分布式系统的经验
  • 熟练掌握Python、Go或Rust编程,并熟悉现代云原生架构
  • 具备容器和编排工具(Kubernetes、Docker)以及基础设施即代码(Terraform)的经验
  • 熟悉调度器或工作负载管理系统(例如,Kubernetes控制器、Slurm、Ray、内部作业队列)
  • 理解可观测性和可靠性实践(指标、追踪、告警、SLO)
  • 拥有在生产环境中提升系统效率、可靠性或开发速度的良好记录

福利待遇

  • 全面的健康、牙科和视力保险
  • 学习和发展津贴
  • 丰厚的带薪休假
  • 可能符合通勤津贴等额外福利的资格