站点可靠性工程师(SRE)- 存储方向
岗位摘要
部署、维护和扩展EB级别的存储集群,重点关注可观测性、零停机升级以及与高密度GPU环境的集成;排查生产环境中的存储问题,涵盖硬件-软件堆栈:NVMe/PCIe/RDMA路径、固件错误、BMC日志、磁盘故障,进行根本原因分析并实现预防自动化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 部署、维护和扩展EB级别的存储集群,重点关注可观测性、零停机升级以及与高密度GPU环境的集成
- 排查生产环境中的存储问题,涵盖硬件-软件堆栈:NVMe/PCIe/RDMA路径、固件错误、BMC日志、磁盘故障,进行根本原因分析并实现预防自动化
- 与存储团队合作,验证服务器规格,调试现场问题,并与供应商共同影响面向尖端AI存储的定制设计
- 评估并引入新的存储供应商和技术;针对AI训练I/O模式,对成本、密度和GPU直接性能进行基准测试
- 支持存储软件开发工程师,将工程需求转化为可靠、可观测的系统;开发脚本和操作手册以减少重复性工作并实现自助服务
- 领导传统X存储设备群的硬件更新,包括迁移、退役,并为定制化解决方案设计可重复的流程
- 参与存储领域的随叫随到轮班(遵循太阳时区,提供丰厚津贴);响应事件,推动事后分析,并为EiB+级别的增长预测容量
- 创建和维护大规模AI管道中存储健康状况的文档、标准操作程序和监控
任职要求
- 计算机科学、工程或相关技术领域的学士学位(或同等经验)
- 在站点可靠性工程、系统工程或相关领域拥有3年以上经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。