高级站点可靠性工程师
岗位摘要
成为关键基础设施的首选负责人,支持源代码配置管理、CI/CD系统、软件分发、供应商门户、制造等关键操作;将SaaS迁移至自托管解决方案,以提升安全性和可靠性;实施监控和警报系统,并定义事件响应计划和操作手册
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 成为关键基础设施的首选负责人,支持源代码配置管理、CI/CD系统、软件分发、供应商门户、制造等关键操作
- 将SaaS迁移至自托管解决方案,以提升安全性和可靠性
- 实施监控和警报系统,并定义事件响应计划和操作手册
- 通过自动化减少人工工作量,实现部署和扩展的自动化
- 与利益相关者建立牢固的关系,识别基础设施需求并设定服务水平目标
- 采用数据驱动的方法展示服务的稳健性并跟踪优化工作
- 与安全团队合作,确保及时应用安全修复和更新
任职要求
- 具备丰富的Linux/Unix系统管理经验
- 熟练掌握编程/脚本编写
- 在云平台(Azure、AWS、GCP)和本地硬件架构方面有丰富经验
- 有设计、部署和操作高可用性、容错和分布式系统的经验
- 熟悉监控、日志记录和警报工具(Prometheus、Grafana、Datadog等)
- 扎实的网络基础知识(TCP/IP、DNS、HTTP、负载均衡器、防火墙)
- 有定义服务水平目标(SLO)、制定操作手册/事件响应计划、促进事后分析和管理系统资产的经验
- 能够与开发、基础设施和产品团队跨职能合作
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。