自动化站点可靠性工程师
岗位摘要
使用Python和Bash开发和维护脚本,用于处理固件包、执行升级,并在Linux和Kubernetes环境中自动化整个流程;与NVIDIA、Dell、Supermicro和HP等供应商的硬件合作,确保固件在数据中心的无缝集成、测试和部署
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 使用Python和Bash开发和维护脚本,用于处理固件包、执行升级,并在Linux和Kubernetes环境中自动化整个流程
- 与NVIDIA、Dell、Supermicro和HP等供应商的硬件合作,确保固件在数据中心的无缝集成、测试和部署
- 实时识别操作问题,设计自动化修复或工作流程来解决它们,并实施可扩展的解决方案以防止问题再次发生
- 与数据中心运营技术人员合作,部署自动化工具,排查与固件相关的问题,并优化高可用性系统的流程
- 将自动化脚本集成到CI/CD管道或Kubernetes等编排工具中,以实现高效的扩展和管理
- 监控和完善自动化流程,确保它们与数据中心可靠性目标保持一致,并最大限度地减少停机时间
- 记录自动化脚本、固件升级程序和问题解决方法,为团队构建可重复使用的知识库
- 参与待命轮班和事件响应,应用自动化技术加速孟菲斯数据中心的故障排除
任职要求
- 计算机科学、工程或相关领域的学士学位(或同等经验)
- 在站点可靠性工程或自动化岗位拥有5年以上经验,最好是在数据中心或云环境中
- 精通Python、Bash、Linux和Kubernetes,用于脚本编写、自动化和编排
- 具有固件包的实际操作经验,包括编写升级脚本和自动化部署流程
- 熟悉NVIDIA、Dell、Supermicro和HP等供应商的硬件,包括在生产环境中的集成和故障排除
- 具备强大的问题解决能力,并有能力识别问题并自动化修复以提高系统效率
- 在高性能计算或AI基础设施环境中有经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。