返回岗位列表

xAI

基础设施可靠性工程师

地点:美国 薪资:$180,000-$400,000 日期:2026-01-29

岗位摘要

定义并执行基础设施可靠性和可扩展性的技术战略;构建和维护自动化、可观测性和控制平面,以确保跨数据中心、混合云/本地环境的健康运行;领导事件响应、深入根本原因分析和事后复盘,推动实际修复

岗位职责

  • 定义并执行基础设施可靠性和可扩展性的技术战略
  • 构建和维护自动化、可观测性和控制平面,以确保跨数据中心、混合云/本地环境的健康运行
  • 领导事件响应、深入根本原因分析和事后复盘,推动实际修复
  • 识别、检测并消除系统性故障模式(容量、网络、硬件、存储、软件)
  • 使用Python和Rust设计和实施高杠杆率的系统软件(守护进程、控制器、调度器等)
  • 推动大规模GPU集群运营和AI工作负载可靠性的技术前沿

任职要求

  • 5年以上生产软件交付和/或大规模分布式基础设施运营经验
  • Linux系统、TCP/IP网络和系统编程的专家级知识
  • 强大的编码技能,具备Rust(强烈优先)以及Python、Go或C++中至少一种语言的生产经验
  • 在本地和云环境(有GCP经验者优先)中具有大规模分布式系统的深厚经验
  • 具备容器编排(Kubernetes、Borg类系统或自定义调度器)、容器运行时和基础设施即代码(Puppet/Chef/Ansible/Terraform)的实践专业知识
  • 深刻理解分布式系统中的常见故障模式及其缓解方法(爆炸半径控制)