返回岗位列表

xAI

站点可靠性工程师(SRE)- 存储方向

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

部署、维护和扩展EB级别的存储集群,重点关注可观测性、零停机升级以及与高密度GPU环境的集成;排查生产环境中的存储问题,涵盖硬件-软件堆栈:NVMe/PCIe/RDMA路径、固件错误、BMC日志、磁盘故障,进行根本原因分析并实现预防自动化

岗位职责

  • 部署、维护和扩展EB级别的存储集群,重点关注可观测性、零停机升级以及与高密度GPU环境的集成
  • 排查生产环境中的存储问题,涵盖硬件-软件堆栈:NVMe/PCIe/RDMA路径、固件错误、BMC日志、磁盘故障,进行根本原因分析并实现预防自动化
  • 与存储团队合作,验证服务器规格,调试现场问题,并与供应商共同影响面向尖端AI存储的定制设计
  • 评估并引入新的存储供应商和技术;针对AI训练I/O模式,对成本、密度和GPU直接性能进行基准测试
  • 支持存储软件开发工程师,将工程需求转化为可靠、可观测的系统;开发脚本和操作手册以减少重复性工作并实现自助服务
  • 领导传统X存储设备群的硬件更新,包括迁移、退役,并为定制化解决方案设计可重复的流程
  • 参与存储领域的随叫随到轮班(遵循太阳时区,提供丰厚津贴);响应事件,推动事后分析,并为EiB+级别的增长预测容量
  • 创建和维护大规模AI管道中存储健康状况的文档、标准操作程序和监控

任职要求

  • 计算机科学、工程或相关技术领域的学士学位(或同等经验)
  • 在站点可靠性工程、系统工程或相关领域拥有3年以上经验