站点可靠性工程师
岗位摘要
开发和优化软件,以在本地环境中配置和管理Kubernetes集群,使xAI能够高效扩展;提升Kubernetes基础设施的可靠性、性能和成本效益,以支持大规模AI和应用程序工作负载;与xAI工程师合作,了解工作负载需求,并设计定制的Kubernetes解决方案以满足其需求
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 开发和优化软件,以在本地环境中配置和管理Kubernetes集群,使xAI能够高效扩展
- 提升Kubernetes基础设施的可靠性、性能和成本效益,以支持大规模AI和应用程序工作负载
- 与xAI工程师合作,了解工作负载需求,并设计定制的Kubernetes解决方案以满足其需求
- 实施稳健的可观测性、监控和安全实践,以确保关键系统的完整性、可用性和机密性
- 使用基础设施即代码工具(如Pulumi、Terraform或Ansible)管理存储基础设施
- 通过事件管理、事后分析和明确定义SLA与SLO来推动系统可靠性
- 为Kubernetes技术栈做出贡献,包括在CNI、CRI、CSI及相关组件方面的专业知识
- 这是一个位于加利福尼亚州帕洛阿尔托的现场职位,需要高达25%的出差
任职要求
- 5年以上站点可靠性工程师或类似职位经验,专注于构建和维护可靠、可扩展的系统
- 在使用Cluster API和kubeadm等工具管理Kubernetes基础设施方面拥有经过验证的专业知识
- 熟练使用Pulumi、Terraform或Ansible等IaC工具管理存储基础设施
- 深入理解Kubernetes技术栈,包括CNI、CRI、CSI及相关组件
- 具备通过事件管理、事后分析和定义SLA/SLO来提高系统可靠性的能力
- 拥有高流量Web或移动应用程序工作负载的经验,包括为大规模部署优化Kubernetes
- 熟悉混沌工程、容量规划或类似的确保系统弹性的实践
- 熟练使用Kyverno、ArgoCD或Go编程等工具进行基础设施自动化
- 具备强烈的责任感、好奇心以及解决复杂问题的热情
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。