工程经理,云基础设施自动化
岗位摘要
组建、领导和发展高性能的基础设施工程团队;负责OpenAI Kubernetes平台的演进,包括集群生命周期、升级、配置标准和安全机制;设定和执行平台级别的可靠性目标(SLIs/SLOs),确保系统设计具备可靠性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 组建、领导和发展高性能的基础设施工程团队
- 负责OpenAI Kubernetes平台的演进,包括集群生命周期、升级、配置标准和安全机制
- 设定和执行平台级别的可靠性目标(SLIs/SLOs),确保系统设计具备可靠性
- 使用Terraform和内部工具推动基础设施自动化,涵盖配置、升级、修复和集群一致性
- 通过更好的抽象、防护栏和自愈系统减少操作繁琐和事故频率
- 建立清晰的职责边界、技术方向和执行纪律
任职要求
- 拥有管理基础设施或平台工程团队的丰富经验
- 对大规模Kubernetes和分布式系统有深入的实践经验
- 曾运营过具有严格可靠性、延迟和安全性要求的生产基础设施
- 能够平衡技术深度与组织领导和长期战略
- 在招聘、发展和留住高级工程师方面有良好的记录
- 适应在模糊、快速变化的环境中工作,并为他人创造清晰度
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。