返回岗位列表

xAI

站点可靠性工程师

地点:美国 薪资:$180,000-$440,000 日期:2026-01-29

岗位摘要

开发和优化软件,以在本地环境中配置和管理Kubernetes集群,使xAI能够高效扩展;提升Kubernetes基础设施的可靠性、性能和成本效益,以支持大规模AI和应用程序工作负载;与xAI工程师合作,了解工作负载需求,并设计定制的Kubernetes解决方案以满足其需求

岗位职责

  • 开发和优化软件,以在本地环境中配置和管理Kubernetes集群,使xAI能够高效扩展
  • 提升Kubernetes基础设施的可靠性、性能和成本效益,以支持大规模AI和应用程序工作负载
  • 与xAI工程师合作,了解工作负载需求,并设计定制的Kubernetes解决方案以满足其需求
  • 实施稳健的可观测性、监控和安全实践,以确保关键系统的完整性、可用性和机密性
  • 使用基础设施即代码工具(如Pulumi、Terraform或Ansible)管理存储基础设施
  • 通过事件管理、事后分析和明确定义SLA与SLO来推动系统可靠性
  • 为Kubernetes技术栈做出贡献,包括在CNI、CRI、CSI及相关组件方面的专业知识
  • 这是一个位于加利福尼亚州帕洛阿尔托的现场职位,需要高达25%的出差

任职要求

  • 5年以上站点可靠性工程师或类似职位经验,专注于构建和维护可靠、可扩展的系统
  • 在使用Cluster API和kubeadm等工具管理Kubernetes基础设施方面拥有经过验证的专业知识
  • 熟练使用Pulumi、Terraform或Ansible等IaC工具管理存储基础设施
  • 深入理解Kubernetes技术栈,包括CNI、CRI、CSI及相关组件
  • 具备通过事件管理、事后分析和定义SLA/SLO来提高系统可靠性的能力
  • 拥有高流量Web或移动应用程序工作负载的经验,包括为大规模部署优化Kubernetes
  • 熟悉混沌工程、容量规划或类似的确保系统弹性的实践
  • 熟练使用Kyverno、ArgoCD或Go编程等工具进行基础设施自动化
  • 具备强烈的责任感、好奇心以及解决复杂问题的热情