高级SRE工程师
岗位摘要
负责核心在线服务的稳定性和性能,确保满足SLO要求;设计和实施架构改进,识别风险保障服务具备容错、降级与快速恢复能力;定期巡检资源水位,基于数据进行容量规划,确保系统能平稳应对业务增长
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责核心在线服务的稳定性和性能,确保满足SLO要求
- 设计和实施架构改进,识别风险保障服务具备容错、降级与快速恢复能力
- 定期巡检资源水位,基于数据进行容量规划,确保系统能平稳应对业务增长
- 设计统一观测平台(Prometheus、Loki、Tempo、Grafana)实现关键指标全覆盖,并持续优化
- 以软件工程方式解决运维问题,用Go/Python构建平台将高频低效运维操作规范化系统化
- 推动监控、报警、容量管理、故障演练的自动化与标准化
- 设计并维护基于Kubernetes的PaaS底座能力,满足业务需求
- 构建持续交付和变更管理流程,关键变更要可灰度、可验证、可回滚
- 参与7x24小时的on-call轮值,快速响应、有序组织人员定位解决线上故障
- 参与里程碑功能上线前的架构评审、测试等准备工作,保证上线后服务持续稳定运行
- 组织故障复盘,推动问题根因分析输出有效可落地的改进措施,持续跟进改进效果
- 与开发团队紧密协作,推动SRE原则和最佳实践落地
- 参与制定流程标准,提升团队整体工程质量和可靠性文化,沉淀最佳实践文档
任职要求
- 计算机科学、电子工程或相关专业本科及以上学历
- 5年以上SRE/DevOps/后端/分布式/云原生相关实践经验
- 有丰富的监控体系、日志分析、故障排查经验,熟悉SLO/SLI/SLA的定义与落地
- 精通Go或Python,能够独立完成生产级系统平台和自动化工具开发
- 深入理解Kubernetes及其生态系统,熟悉Ingress、ArgoCD
- 掌握Prometheus、Grafana、Alertmanager、OpenTelemetry,能够设计并监控可靠性指标
- 精通TCP/IP、HTTP/2、gRPC等协议;对系统性能与故障诊断有深刻理解
- 对新技术有持续学习与实践的热情,能够带动团队技术成长
- 实事求是、数据驱动、思维敏捷,具备优秀沟通协作能力,能够推动复杂问题在组织内落地解决
福利待遇
- 月薪35-50K,16薪
- 工作地点位于北京海淀区京东科技大厦
工作地址
北京海淀区京东科技大厦13
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。