站点可靠性工程师
岗位摘要
构建自动化管理、部署和操作服务的自助服务系统;开发支持语言模型部署的自定义Kubernetes操作器;自动化环境可观测性和弹性,使所有开发人员能够排查和解决问题;采取必要措施确保达到定义的SLO,包括参与待命轮换
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建自动化管理、部署和操作服务的自助服务系统
- 开发支持语言模型部署的自定义Kubernetes操作器
- 自动化环境可观测性和弹性,使所有开发人员能够排查和解决问题
- 采取必要措施确保达到定义的SLO,包括参与待命轮换
- 与内部开发人员建立牢固关系,并根据他们的反馈影响基础设施团队的路线图
- 通过知识共享和积极的评审流程来发展团队
任职要求
- 拥有5年以上大规模生产基础设施工程经验
- 具备使用Kubernetes设计大型、高可用分布式系统以及在这些集群上运行GPU工作负载的经验
- 拥有Kubernetes开发、生产编码和支持经验
- 具备GCP、Azure、AWS、OCI、多云/本地/混合部署经验
- 拥有在基于Linux的复杂计算环境中设计、部署、支持和故障排除的经验
- 具备计算/存储/网络资源和成本管理经验
- 拥有出色的协作和故障排除技能,以构建关键任务系统,并确保平稳运营和高效团队合作
- 具备解决日常变化的复杂技术挑战的毅力和适应能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。